KeyFrame內部研究專用

Citation Needed: Provenance for LLM-Built Knowledge Graphs — Daniel Chalef, Zep AI

AI Engineer·7月23日週四·20 min英文

三句話摘要

在 LLM 系統中追蹤數據出處,建構具有譜系追溯能力的企業記憶體基礎設施。 出處追蹤必須設計進數據結構而非事後補救,知識圖搭配元資料標籤是企業級 LLM 系統滿足合規、驗證和隱私要求的核心基礎設施。 LLM 的綜合問題:LLM 能跨多源整合數據生成摘要和事實,但合成過程會抹去原始記錄,造成出處丟失。法律合規和除錯都需要追溯這些資訊。

重點整理

重點
  • 1

    LLM 的綜合問題:LLM 能跨多源整合數據生成摘要和事實,但合成過程會抹去原始記錄,造成出處丟失。法律合規和除錯都需要追溯這些資訊。

  • 2

    知識圖譜建模:Graffiti 將事實與源數據的關係建模為知識圖,用實體、邊和元數據標籤追蹤演變過程。當實體合併或新數據推翻舊事實時,圖會記錄這些變異。

  • 3

    多源事實的驗證挑戰:事實可能源自三個以上的父資料來源,若某個來源未經驗證或待刪除,代理需要根據業務規則判斷是否保留該事實,單純依靠圖無法決定。

  • 4

    隱私合規的實現:當須刪除某個來源數據時,圖能清楚識別哪些事實依賴於該來源。只有當沒有任何剩餘來源支持某事實時,才完全刪除該事實。

實用技巧與重點

乾貨
  • 工具框架:Graffiti(開源時間圖框架)、Zep(企業代理記憶體基礎設施)
  • 知識圖結構:實體、邊(事實)、元數據標籤、無效日期
  • 資料處理流程:結構化提取(實體+關係)→ 去重與衝突消除 → 圖物化
  • 技術方法:向量相似性搜尋、全文搜尋、圖遍歷(廣度優先搜尋)、NLP 技術(熵、sim 雜湊)而非 LLM
  • 應用場景:醫療保健(患者過敏資訊)、合規檢查、隱私刪除、事實驗證

結論

結論

出處追蹤必須設計進數據結構而非事後補救,知識圖搭配元資料標籤是企業級 LLM 系統滿足合規、驗證和隱私要求的核心基礎設施。

完整解析

詳細

LLM 在整合多個資料來源(電子郵件、聊天記錄、文件、業務資料)時,雖然能產生準確摘要和結構化事實,但這個合成過程本質上是有損的——原始資訊的出處會被隱沒。在醫療保健等高風險場景中,如果代理從EHR記錄、實驗室報告、患者輸入三個來源綜合出「患者對青黴素過敏」這一事實,但沒有清楚標註每條資訊的來源,醫生可能被誤導,尤其當部分來源可信度低時。

Graffiti框架透過知識圖來解決這個問題。它將原始資料記錄建模為「劇集」(圖上的節點),從中提取出實體與事實(三元組:主詞-動詞-受詞),並用邊連結事實與其源頭。當實體合併時(如「J. Smith」和「John Smith」合為一個身分),圖會保留來自兩個身分的所有出處鏈接。當新資料推翻舊事實時(例如丹尼爾後來退回了阿迪達斯鞋),系統會在邊上標記無效日期並記錄導致變異的源事件,完整保留演變歷史。

元資料標籤進一步強化了事實驗證能力。在資料攝取時,系統可標記來源為「EHR驗證」或「未驗證」,所有衍生實體與事實都會繼承該標籤。代理在遍歷圖時可依業務規則篩選特定標籤的資訊。對於多源事實(如患者過敏同時來自驗證與未驗證來源),代理和業務規則層需要配合決定是否採用——圖本身只展示事實,決定權在應用層。

隱私合規也因此變得可執行:當法律要求刪除某個來源的資料時,系統能清晰辨別哪些事實完全依賴該來源、哪些是多源支撐。只有當所有父來源都被刪除或沒有剩餘來源時,才會級聯刪除該事實。相比之下,基於Markdown文件的記憶體系統難以追蹤修改來源、在多實體多來源場景中管理複雜度高,Graffiti透過圖結構天生支持這些需求。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。