The Future of Evals: From LLM as a Judge to Agent as a Judge — Aparna Dhinakaran, Arize AI
三句話摘要
Arize 發表代理評估的演進方向:從傳統 LLM 評判轉向「代理作為評委」的新範式。 AI 代理的評估已進入新時代——從靜態評分標準轉向動態代理評委,以適應系統複雜度的指數級增長。 評估的複雜度隨代理進化而跳躍:2023 年只需評估單一問題回答,2024 年代理加入工具調用、推理、長期任務執行後,每次系統的故障方式都質變,需要本質不同的評估方法。
重點整理
重點- 1
評估的複雜度隨代理進化而跳躍:2023 年只需評估單一問題回答,2024 年代理加入工具調用、推理、長期任務執行後,每次系統的故障方式都質變,需要本質不同的評估方法。
- 2
傳統 LLM 評判者的侷限性:LLM 評委只能給出固定評分標準和固定分數,但代理每次使用者交互都走不同軌跡(動態流程),導致傳統評估無法捕捉上下文忽略、循環卡頓、工具重複調用等問題。
- 3
代理評委的適應性:Signal 可讀取執行痕跡、識別問題模式、發現確定性評分標準永遠無法解決的細微故障(如工具被長時間反覆調用、軌跡效率低下),並主動提交修復方案。
- 4
三層評估體系的未來:確定性評估、LLM 作為評委、代理作為評委三種方法各有所用,未來的成熟評估系統需要結合全部三層。
實用技巧與重點
乾貨- Arize 的評估規模
- 每月超過 1 億次評估
- 平均團隊執行約 12 個不同評估任務
- 頂尖團隊執行 3,800+ 個不同評估任務
- Signal 工具特性
- 長期運行的代理
- 可讀取執行痕跡(trace data)
- 發現問題模式與故障類型
- 可提交 PR 提出修復方案
- 代理系統演化軌跡
- 2023 年:單一問題回答
- 2024 年:工具調用、推理能力、深度研究、子代理派遣
- 2025 年+:在真實世界數據上執行循環、長期任務
- Arize 內部代理案例(Alex)
- 增強記憶能力
- 建立動態 UI 能力
- 海量痕跡搜尋能力
- 已發現的失敗模式:上下文忽略、時間感知缺陷、無限循環
結論
結論“AI 代理的評估已進入新時代——從靜態評分標準轉向動態代理評委,以適應系統複雜度的指數級增長。”
完整解析
詳細Aparna 開場指出,評估已從個別技能演變成所有嚴肅 AI 團隊的核心投資。Arize 與業界頂尖團隊合作,每月處理超過 1 億次評估,觀察到一個關鍵現象:系統複雜度每年都在跳躍式成長。2023 年時,評估的對象是單純回答問題的模型;到了 2024 年,前沿模型開始加入工具調用、多步推理、代理派遣等能力;如今 AI 系統在真實世界數據上執行長期循環,每一次複雜度的躍升都代表一種本質上不同的故障類型。
傳統的評估工具無法適應這種變化。LLM 作為評委——即使用固定的評分標準和 Prompt 來評估系統輸出——在單一問題上有效,但對動態代理系統無效。Arize 自家開發的代理 Alex 是個真實案例:雖然它擁有增強記憶、動態 UI 生成、海量痕跡搜尋等能力,卻會在不知道某事何時發生的情況下忽視上下文、陷入無限循環。這些故障既不是確定性流程能事先預測的,也不是靜態評分標準能評判的。
基於這個洞察,Arize 提出一個根本性的轉變:既然代理系統本身具有適應性和動態性,最適合評估代理的方法就是讓另一個代理來評估它。Aparna 將此分為三層體系:確定性評估(檢查預定義規則)、LLM 評委(應用固定評分標準)、代理評委(動態追蹤與模式分析)。大多數團隊目前停留在前兩層,但未來趨勢是結合全部三層。
Arize 推出的新工具 Signal 實現了「代理作為評委」的概念。Signal 是一個長期運行的代理,持續讀取系統執行的痕跡數據,發現問題模式,並識別傳統 LLM 評委永遠無法檢測的失敗類型——例如同一工具被反覆長時間調用、軌跡效率低下、上下文被遺忘。更進一步,Signal 不僅發現問題,還能分析根本原因,提交包含修復建議的 PR。這種方法使評估從被動檢查演變成主動的持續改進循環。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


