Why Your Agent Disagrees With Itself (And What To Do About It) - Diane Lin, Datadog
三句話摘要
AI 代理程式為何對相同輸入產生不同輸出,以及如何透過主動學習和記憶增強來解決不一致問題。 AI agent 的不一致不是模型故障,而是邊界資訊不足,透過主動學習發現問題並用語義與情節記憶增強,比盲目重新訓練更高效且更貼近客戶需求。 不一致集中在決策邊界的灰色地帶,例如邊界飯店評論、密碼噴灑攻擊失敗等案例,即使人類專家也會意見分歧。
重點整理
重點- 1
不一致集中在決策邊界的灰色地帶,例如邊界飯店評論、密碼噴灑攻擊失敗等案例,即使人類專家也會意見分歧。
- 2
根本問題不在模型本身,而是缺乏足夠的資訊或公司政策澄清,來區分邊界兩側的不同情景。
- 3
主動學習透過監測多次運行間的分歧,比 LLM 的信心分數更可靠,因為 LLM 往往「不知道自己不知道」。
- 4
語義記憶(固化領域知識)和情節記憶(自動參考歷史案例)互補而非衝突,避免了昂貴的模型重新訓練。
實用技巧與重點
乾貨- 測試結果(93 條安全警報):未處理時 25% 翻轉,用情節記憶後 15% 改善,剩餘 10% 需人工審查
- 飯店評論案例:超出飯店控制範圍的抱怨→標記為正面(語義記憶規則)
- 安全警報案例:密碼噴灑(password spray)失敗登入 → 標記為良性;成功登入後失敗 → 標記為惡意
- 主動學習技術:已知的傳統 ML 方法,需調整選擇策略以適用於 LLM
- 選擇策略:使用多次運行或多模型間的分歧信號,優於 LLM 的不確定性分數
- 記憶類型:語義記憶(明確化知識、決策規則);情節記憶(過往案例及決策紀錄)
結論
結論“AI agent 的不一致不是模型故障,而是邊界資訊不足,透過主動學習發現問題並用語義與情節記憶增強,比盲目重新訓練更高效且更貼近客戶需求。”
完整解析
詳細講者以 MIT、Google、網路安全公司與 Datadog 的經歷為基礎,指出生產環境中 AI agent 的一個實際難題:同一個 LLM 模型、完全相同的輸入,卻經常產生語義上不同的輸出。這不只是措辭不同,而是判斷結論的反轉。
透過兩個鮮明的案例說明這個現象。飯店評論情感分析中,某些評論無論執行多少次都穩定輸出;但某些邊界評論則在正面與負面之間搖擺。在網路安全領域,一個登入失敗警報有時被判定為惡意威脅,有時被判定為良性。這種不一致直接影響產品信任度——客戶會傾向選擇判斷穩定的供應商。
這個問題的根本原因不在模型,而在決策邊界。不一致的案例都集中在「灰色地帶」——資訊確實模糊的邊界。飯店評論中某些詞彙相對主觀,安全警報中攻擊者可能仍在敲門而未突破。這類情況下,即使人類專家也會有分歧,因為答案取決於業務偏好而非客觀事實。飯店可能認為超出自身控制的抱怨無法改進,故不標記為負面;另一家飯店可能想追蹤此類反饋。安全團隊則需要區分:攻擊者在門外試圖進入,還是已突破但尚未完全控制環境?這完全改變應對策略。
傳統機器學習有一套成熟的解決方案:主動學習。其核心思想是不標記全部數據,而是聰明地挑選模型最不確定、最具學習價值的案例請人工審查。在 LLM 時代,這個框架需要微調。最重要的改變是:放棄依賴 LLM 的信心分數(LLM 往往自信卻錯誤),改用「分歧信號」——即同一 agent 多次運行間的分歧,或不同模型的分歧。這更能可靠地指向模型真正不確定的地方。
識別出問題案例後,講者提出比重新訓練更輕量的方案:用語義記憶和情節記憶增強 agent。語義記憶是明確的領域知識和公司政策——例如為飯店系統添加「抱怨超出控制範圍時標記為正面」、為安全系統添加「無成功登入的密碼噴灑應標記為良性」。情節記憶是歷史案例的自動參考——系統記住過去相似案例及其決策,新案例到來時自動查詢。情節記憶需要較少人工干預,特別適合高重複的假警告;語義記憶適合一次性的策略澄清。兩者互補:情節記憶自動處理已知問題,剩餘案例由人工審查進一步提煉成語義知識供下次使用。
實驗驗證了這個方法的效果。在 93 條真實安全警報上,未採用方案時 25% 翻轉判斷;引入情節記憶後 15% 改善一致,剩餘 10% 需人工審查。關鍵是人工只需審查這 10%,效率大幅提升。隨著人工審查累積,領域知識逐漸充實,系統適應客戶環境的能力不斷增強。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


