KeyFrame內部研究專用

Enterprise Agents Have a Structure Problem - Ishita Daga, Tesla

AI Engineer·7月20日週一·12 min英文

三句話摘要

企業數據代理存在的三個結構性問題:歧義、陳舊和偏好,需要從架構設計而非單純擴大模型著手解決。 企業數據代理的成敗取決於架構設計和管理流程,而非單純依賴更強大的模型——需要分層的真理來源、自動化的上下文生命週期,以及身份感知的偏好路由。 真理來源應分層設計。將知識庫按清晰度與靈活性分為三層:語義層(最清晰但最不靈活)、規範表格(中等靈活性)、資料庫圖(最靈活但維護成本最高)。代理應從最清晰的層級開始逐步過渡,這樣既能確保準確性又能提升靈活性。

重點整理

重點
  • 1

    真理來源應分層設計。將知識庫按清晰度與靈活性分為三層:語義層(最清晰但最不靈活)、規範表格(中等靈活性)、資料庫圖(最靈活但維護成本最高)。代理應從最清晰的層級開始逐步過渡,這樣既能確保準確性又能提升靈活性。

  • 2

    建立上下文生命週期機制。嵌入經常更新的活資料來源(如 GitHub、CRM、語義層),並配合回饋循環捕捉每個錯誤事件。定期記錄、評估和更新代理上下文,才能跟上業務變化的速度。

  • 3

    偏好問題需要身份路由。由於不同團隊對同一指標的定義和計算方法存在主觀差異,最終解決方案應根據用戶或團隊的身份將代理路由到正確的指標定義,而非依賴單一標準答案。

實用技巧與重點

乾貨
  • 真理來源三層結構:語義層(KPI 定義、指標計算方法、業務定義)、規範表格(參數查詢組)、資料庫圖(表與列的連接關係圖)
  • 80% 問題可由前兩層解決,剩餘 20% 才需資料庫圖
  • 活資料來源包括:GitHub、CRM 工具、Tableau、DBT、語義層
  • 回饋循環的兩部分:事件捕捉記錄(數據正確性、定義更新、篩選條件變更)+ 自動化評估(對比過去問題與實際答案的接近度)
  • 偏好解決方案:語義層存儲多種計算方法、代理記憶(如 MemZero)、身份路由機制

結論

結論

企業數據代理的成敗取決於架構設計和管理流程,而非單純依賴更強大的模型——需要分層的真理來源、自動化的上下文生命週期,以及身份感知的偏好路由。

完整解析

詳細

企業數據代理常常失敗,但根本原因往往被誤解。當代理給出錯誤答案時,人們直覺地認為需要更大的模型、更新的技術或更多的上下文知識庫。然而,伊希塔·達加指出,這些表面解決方案並未觸及問題核心。真正的挑戰在於代理對知識結構的管理方式。

第一個核心問題是歧義。代理無法判斷應該使用哪個真理來源——是該查詢哪個表、哪一列,還是應該訪問哪個知識庫?當一個企業擁有多個資料來源時,代理無法區分優先級。解決方案是將真理來源分層:最頂層是精心整理的語義層,包含所有 KPI 定義和業務規則,代理可以直接參考;中層是一組規範查詢表,賦予代理更多靈活性去選擇查詢邏輯;底層是完整的資料庫圖,允許代理在必要時進行復雜聯接。這種分層方式讓代理從最清晰的答案開始,逐步過渡到更動態的資料來源,效率和準確性兼顧。

第二個問題是陳舊。企業環境變化極快,KPI 定義、流程、篩選條件不斷更新,但維護代理的上下文卻異常困難——文檔頻繁過時,技能配置難以同步。解決方案是建立「上下文生命週期」:嵌入經常自動更新的活資料來源,確保代理總是獲取最新資訊;同時建立回饋循環,捕捉用戶報告的每一個錯誤或變更需求,記錄這些事件,並定期評估代理性能。通過自動化評估對比過去數天的提問與實際答案,可以驗證上下文是否仍然準確。

第三個問題是偏好,也是最具挑戰性的。假設 A 團隊和 B 團隊都需要計算「完成里程碑的平均時間」,但 A 團隊是從上一里程碑完成到當前里程碑完成,而 B 團隊是從當前里程碑開始到下一里程碑開始。兩種計算都沒錯,但結果完全不同。這是純粹的主觀偏好問題。目前業界還沒有完美解決方案,嘗試過的方法包括在語義層存儲多個定義讓用戶選擇、或使用代理記憶存儲個人偏好,但都無法根本解決問題。真正需要的是根據用戶或團隊身份自動路由到正確指標的機制。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。