KeyFrame內部研究專用

2026 AI 小學堂EP4|打造不亂講的 AI:企業知識庫與 RAG 應用的關鍵方法

SYSTEX 產品共享中心·6月22日週一·25 min中文

三句話摘要

如何通過Oracle數據庫的技術機制,在保證AI回應準確的同時,防止無意中泄露敏感企業資訊。 企業AI安全的關鍵在於將防護重心從AI應用層轉移到數據庫層,透過VPD等原生機制確保敏感數據權限,遠比追著AI技術演進修補漏洞更有效。 向量搜尋的相對距離陷阱:向量相似度計算基於相對距離,即使無關提問也會找到「最接近」的文件。例如問台北捷運系統卻得到西餐食譜,是因為雖然距離遠,但相對仍是最近的三個區塊。

重點整理

重點
  • 1

    向量搜尋的相對距離陷阱:向量相似度計算基於相對距離,即使無關提問也會找到「最接近」的文件。例如問台北捷運系統卻得到西餐食譜,是因為雖然距離遠,但相對仍是最近的三個區塊。

  • 2

    ReRank模型作為第二層過濾:引入ReRank模型評估語義相關性,給每個匹配設分數,並設定相關性閾值。若分數未達標準就捨棄該文件片段,即使它在向量搜尋中排名最靠前。

  • 3

    AI Agent的安全困境:由於Agent具有「使命必達」特性,只要有工具和權限就會嘗試回答,應用層的限制容易被技術演進繞過。安全不應依賴控制Agent行為。

  • 4

    從資料源頭做安全控管:在數據庫層用VPD等機制限制數據存取權限,不論有多少個AI系統或技術如何演進,只要底層數據權限設對,就能根本確保安全。

實用技巧與重點

乾貨
  • Oracle AI-DIF-26 數據庫版本
  • Vector Embedding 向量化技術,將文本轉換為多維數字編碼
  • Chunk分塊 將長文檔切分成適合模型處理的片段
  • VECTOR_DISTANCE Oracle中的向量距離計算函數
  • ReRank模型 評估兩個文本的語義相關性,輸出0-1分數
  • Sigmoid函數 標準化分數到0-1區間
  • Oracle SQL MCP Server 免費工具,連接AI Agent與Oracle數據庫
  • VPD (Virtual Private Database) 虛擬私有數據庫,設定行級別的存取條件
  • Connection Stream 數據庫連接管理機制

結論

結論

企業AI安全的關鍵在於將防護重心從AI應用層轉移到數據庫層,透過VPD等原生機制確保敏感數據權限,遠比追著AI技術演進修補漏洞更有效。

完整解析

詳細

講座開場點出企業AI應用的核心痛點:大型語言模型容易生成看似合理卻與實際資料不符的回答,風險在於無意中洩露敏感訊息。要打造「不亂講的AI」,必須結合向量搜尋、模型控制和數據庫安全機制。

周顧問首先解釋Vector Embedding的原理。向量是將文本轉換為多維數字編碼,代表語意而非內容。人類只能理解三維空間,但通過數學可計算多維向量的距離——距離越短表示意義越相近。在RAG(檢索增強生成)系統中,文件先被提取文字、分塊處理,再透過Embedding模型轉換為向量存入數據庫。用戶提問同樣經Embedding轉換,系統找出向量距離最短的文件片段,傳給生成式模型產生答案。

但核心問題是相對距離陷阱。即使提問完全無關(如問西餐食譜給捷運系統),系統仍會找到相對最近的三個區塊,因為「最近的不相關」仍優於「次近的不相關」。這導致生成看似有據卻實則錯誤的回答。

解決方案是引入ReRank模型。與Embedding模型不同,ReRank直接評估兩個文本的語義相關性,輸出0-1分數。透過設定閾值(如Sigmoid標準化後),若相關性分數未達標準,即使向量搜尋排名高也會被拒絕。實測顯示,相同無關提問經ReRank過濾後,系統會正確回應「無法提供答案」。

第二個風險來自AI Agent的特性。Agent被設計為「使命必達」,只要有工具和數據庫存取權,就會竭力完成任務。講座示例展示Agent輕易洩露員工主管薪資,儘管企業可能想限制這類敏感查詢,但隨著Agent技術快速演進,應用層防守容易被繞過,甚至不可能完全阻擋。

真正的安全保障應該從數據源頭做起。Oracle提供的VPD(虛擬私有數據庫)機制,在數據庫查詢時自動附加存取條件,無論Agent多聰明都無法取得無權限的數據。企業無需在數十、數百個AI系統各自設防,只需在一個數據庫層確保權限控管,所有系統自動遵守。實際演示中,套用VPD後,同樣查詢薪資的Agent發現結果為空,無論如何嘗試都無法繞過。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。