KeyFrame內部研究專用

Why Your Agent Disagrees With Itself (And What To Do About It) - Diane Lin, Datadog

AI Engineer·7月20日週一·25 min英文

三句話摘要

AI 代理程式為何對相同輸入產生不同輸出,以及如何透過主動學習和記憶增強來解決不一致問題。 AI agent 的不一致不是模型故障,而是邊界資訊不足,透過主動學習發現問題並用語義與情節記憶增強,比盲目重新訓練更高效且更貼近客戶需求。 不一致集中在決策邊界的灰色地帶,例如邊界飯店評論、密碼噴灑攻擊失敗等案例,即使人類專家也會意見分歧。

重點整理

重點
  • 1

    不一致集中在決策邊界的灰色地帶,例如邊界飯店評論、密碼噴灑攻擊失敗等案例,即使人類專家也會意見分歧。

  • 2

    根本問題不在模型本身,而是缺乏足夠的資訊或公司政策澄清,來區分邊界兩側的不同情景。

  • 3

    主動學習透過監測多次運行間的分歧,比 LLM 的信心分數更可靠,因為 LLM 往往「不知道自己不知道」。

  • 4

    語義記憶(固化領域知識)和情節記憶(自動參考歷史案例)互補而非衝突,避免了昂貴的模型重新訓練。

實用技巧與重點

乾貨
  • 測試結果(93 條安全警報):未處理時 25% 翻轉,用情節記憶後 15% 改善,剩餘 10% 需人工審查
  • 飯店評論案例:超出飯店控制範圍的抱怨→標記為正面(語義記憶規則)
  • 安全警報案例:密碼噴灑(password spray)失敗登入 → 標記為良性;成功登入後失敗 → 標記為惡意
  • 主動學習技術:已知的傳統 ML 方法,需調整選擇策略以適用於 LLM
  • 選擇策略:使用多次運行或多模型間的分歧信號,優於 LLM 的不確定性分數
  • 記憶類型:語義記憶(明確化知識、決策規則);情節記憶(過往案例及決策紀錄)

結論

結論

AI agent 的不一致不是模型故障,而是邊界資訊不足,透過主動學習發現問題並用語義與情節記憶增強,比盲目重新訓練更高效且更貼近客戶需求。

完整解析

詳細

講者以 MIT、Google、網路安全公司與 Datadog 的經歷為基礎,指出生產環境中 AI agent 的一個實際難題:同一個 LLM 模型、完全相同的輸入,卻經常產生語義上不同的輸出。這不只是措辭不同,而是判斷結論的反轉。

透過兩個鮮明的案例說明這個現象。飯店評論情感分析中,某些評論無論執行多少次都穩定輸出;但某些邊界評論則在正面與負面之間搖擺。在網路安全領域,一個登入失敗警報有時被判定為惡意威脅,有時被判定為良性。這種不一致直接影響產品信任度——客戶會傾向選擇判斷穩定的供應商。

這個問題的根本原因不在模型,而在決策邊界。不一致的案例都集中在「灰色地帶」——資訊確實模糊的邊界。飯店評論中某些詞彙相對主觀,安全警報中攻擊者可能仍在敲門而未突破。這類情況下,即使人類專家也會有分歧,因為答案取決於業務偏好而非客觀事實。飯店可能認為超出自身控制的抱怨無法改進,故不標記為負面;另一家飯店可能想追蹤此類反饋。安全團隊則需要區分:攻擊者在門外試圖進入,還是已突破但尚未完全控制環境?這完全改變應對策略。

傳統機器學習有一套成熟的解決方案:主動學習。其核心思想是不標記全部數據,而是聰明地挑選模型最不確定、最具學習價值的案例請人工審查。在 LLM 時代,這個框架需要微調。最重要的改變是:放棄依賴 LLM 的信心分數(LLM 往往自信卻錯誤),改用「分歧信號」——即同一 agent 多次運行間的分歧,或不同模型的分歧。這更能可靠地指向模型真正不確定的地方。

識別出問題案例後,講者提出比重新訓練更輕量的方案:用語義記憶和情節記憶增強 agent。語義記憶是明確的領域知識和公司政策——例如為飯店系統添加「抱怨超出控制範圍時標記為正面」、為安全系統添加「無成功登入的密碼噴灑應標記為良性」。情節記憶是歷史案例的自動參考——系統記住過去相似案例及其決策,新案例到來時自動查詢。情節記憶需要較少人工干預,特別適合高重複的假警告;語義記憶適合一次性的策略澄清。兩者互補:情節記憶自動處理已知問題,剩餘案例由人工審查進一步提煉成語義知識供下次使用。

實驗驗證了這個方法的效果。在 93 條真實安全警報上,未採用方案時 25% 翻轉判斷;引入情節記憶後 15% 改善一致,剩餘 10% 需人工審查。關鍵是人工只需審查這 10%,效率大幅提升。隨著人工審查累積,領域知識逐漸充實,系統適應客戶環境的能力不斷增強。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。