Citation Needed: Provenance for LLM-Built Knowledge Graphs — Daniel Chalef, Zep AI
三句話摘要
在 LLM 系統中追蹤數據出處,建構具有譜系追溯能力的企業記憶體基礎設施。 出處追蹤必須設計進數據結構而非事後補救,知識圖搭配元資料標籤是企業級 LLM 系統滿足合規、驗證和隱私要求的核心基礎設施。 LLM 的綜合問題:LLM 能跨多源整合數據生成摘要和事實,但合成過程會抹去原始記錄,造成出處丟失。法律合規和除錯都需要追溯這些資訊。
重點整理
重點- 1
LLM 的綜合問題:LLM 能跨多源整合數據生成摘要和事實,但合成過程會抹去原始記錄,造成出處丟失。法律合規和除錯都需要追溯這些資訊。
- 2
知識圖譜建模:Graffiti 將事實與源數據的關係建模為知識圖,用實體、邊和元數據標籤追蹤演變過程。當實體合併或新數據推翻舊事實時,圖會記錄這些變異。
- 3
多源事實的驗證挑戰:事實可能源自三個以上的父資料來源,若某個來源未經驗證或待刪除,代理需要根據業務規則判斷是否保留該事實,單純依靠圖無法決定。
- 4
隱私合規的實現:當須刪除某個來源數據時,圖能清楚識別哪些事實依賴於該來源。只有當沒有任何剩餘來源支持某事實時,才完全刪除該事實。
實用技巧與重點
乾貨- 工具框架:Graffiti(開源時間圖框架)、Zep(企業代理記憶體基礎設施)
- 知識圖結構:實體、邊(事實)、元數據標籤、無效日期
- 資料處理流程:結構化提取(實體+關係)→ 去重與衝突消除 → 圖物化
- 技術方法:向量相似性搜尋、全文搜尋、圖遍歷(廣度優先搜尋)、NLP 技術(熵、sim 雜湊)而非 LLM
- 應用場景:醫療保健(患者過敏資訊)、合規檢查、隱私刪除、事實驗證
結論
結論“出處追蹤必須設計進數據結構而非事後補救,知識圖搭配元資料標籤是企業級 LLM 系統滿足合規、驗證和隱私要求的核心基礎設施。”
完整解析
詳細LLM 在整合多個資料來源(電子郵件、聊天記錄、文件、業務資料)時,雖然能產生準確摘要和結構化事實,但這個合成過程本質上是有損的——原始資訊的出處會被隱沒。在醫療保健等高風險場景中,如果代理從EHR記錄、實驗室報告、患者輸入三個來源綜合出「患者對青黴素過敏」這一事實,但沒有清楚標註每條資訊的來源,醫生可能被誤導,尤其當部分來源可信度低時。
Graffiti框架透過知識圖來解決這個問題。它將原始資料記錄建模為「劇集」(圖上的節點),從中提取出實體與事實(三元組:主詞-動詞-受詞),並用邊連結事實與其源頭。當實體合併時(如「J. Smith」和「John Smith」合為一個身分),圖會保留來自兩個身分的所有出處鏈接。當新資料推翻舊事實時(例如丹尼爾後來退回了阿迪達斯鞋),系統會在邊上標記無效日期並記錄導致變異的源事件,完整保留演變歷史。
元資料標籤進一步強化了事實驗證能力。在資料攝取時,系統可標記來源為「EHR驗證」或「未驗證」,所有衍生實體與事實都會繼承該標籤。代理在遍歷圖時可依業務規則篩選特定標籤的資訊。對於多源事實(如患者過敏同時來自驗證與未驗證來源),代理和業務規則層需要配合決定是否採用——圖本身只展示事實,決定權在應用層。
隱私合規也因此變得可執行:當法律要求刪除某個來源的資料時,系統能清晰辨別哪些事實完全依賴該來源、哪些是多源支撐。只有當所有父來源都被刪除或沒有剩餘來源時,才會級聯刪除該事實。相比之下,基於Markdown文件的記憶體系統難以追蹤修改來源、在多實體多來源場景中管理複雜度高,Graffiti透過圖結構天生支持這些需求。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


