How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, YouTube Ads
三句話摘要
YouTube廣告團隊分享如何構建生產級的AI代理評估系統。 評估系統的核心是先用直觀小規模評估找出失敗模式,再逐步擴展到自動化和多維度評估,同時嚴格監控評估品質本身,才能有效指導AI代理的迭代改進。 評估體系的演進路徑:先從小規模的直觀評估開始(PM+核心團隊手動測試),只需幾個核心任務;隨著進度擴展到專業評估團隊、更大的黃金標準資料集,最後整合LLM評判者和人類評判者的混合模式。過早擴展自動化評估會導致頻繁的評估校準工作,反而拖累代理開發速度。
重點整理
重點- 1
評估體系的演進路徑:先從小規模的直觀評估開始(PM+核心團隊手動測試),只需幾個核心任務;隨著進度擴展到專業評估團隊、更大的黃金標準資料集,最後整合LLM評判者和人類評判者的混合模式。過早擴展自動化評估會導致頻繁的評估校準工作,反而拖累代理開發速度。
- 2
評分標準的精確性決定執行質量:規模評估者最常遇到的問題是邊界情況的判斷不明確。必須提供極為清晰的評分標準配合具體範例,讓評估者理解什麼是合格、什麼是不合格,團隊內部對好案例要達成高度共識。詢問評估者「為什麼這樣評分」能挖掘代理的真實改進空間。
- 3
多維度評估比簡單的通過/失敗更有價值:不只看通過率,要從品牌安全、準確度、邏輯可追溯性等多個維度評估。檢查代理的思考過程(追蹤日誌)比只看最終結果更能找到問題根源;一個廣告可能在品牌安全上合格但準確度失格,這些細節指導代理的針對性改進。
- 4
發布前的嚴格驗證機制:需要進行消融實驗(A/B測試)理解模型退化在哪裡,明確定義可接受的回歸閾值。關鍵是關注模式而非孤立的運作——不因單個失敗例子改提示詞,而要確保在黃金標準集中有多個例子覆蓋該模式;持續用生產數據更新測試集,投資線上評估來驗證現實世界表現。
實用技巧與重點
乾貨- 評估系統的三層架構
- 能力(代理的基礎LLM和工具優化)
- 護欄(自我糾正機制、補救循環)
- 評估(衡量現實世界表現)
- 具體失敗案例
- 代理被指示「禁止刪除法律免責聲明」,但在特定情況下仍刪除了。追蹤日誌顯示:代理檢測到免責聲明→決定刪除(違反指示)→實際執行刪除。單純看通過率無法發現此類邏輯錯誤
- 多維度評估的維度
- 廣告準確性(是否符合要求)
- 品牌安全性(是否存在安全隱患)
- 是否與預期相符
- 這些維度可獨立評分而非單一合格/不合格判定
- 評估演進階段
- 初期:直觀評估(數個核心任務)
- 成長期:專業評估團隊、黃金標準資料集擴大
- 成熟期:人類評估+LLM評判者、監控一致性率、採樣驗證
- 質量控制機制
- 樣本抽查(檢查邏輯背後的推理)
- 監控人類vs.LLM評判的分歧率
- 定期用生產數據刷新測試集
- 設定明確的發布標準(精確率/召回率閾值等)
結論
結論“評估系統的核心是先用直觀小規模評估找出失敗模式,再逐步擴展到自動化和多維度評估,同時嚴格監控評估品質本身,才能有效指導AI代理的迭代改進。”
完整解析
詳細構建一套有效的AI代理評估系統是生產環境部署的關鍵瓶頸。YouTube廣告團隊在開發圖像和視頻廣告生成代理時發現,生成式AI的非確定性特質使得無法完全保證其輸出質量,因此需要建立大規模衡量機制來確保產品達到預期效果。代理的可靠性三角形由能力、護欄和評估三要素支撐,其中評估是理解代理在真實場景中如何表現的關鍵。
講者強調一個看似違反直覺但極為有效的做法:不要一開始就構建完全自動化的評估系統。相反,應該從小規模的直觀評估開始。在初期,由PM和核心體驗團隊手動測試幾個核心任務,即使這種方法無法規模化。這樣做的好處是能快速理解代理的失敗模式,進行徹底的架構改進而不被評估流程卡住。一旦代理的基礎穩固,才逐步擴展到專業評估團隊、更大的黃金標準資料集,最後才整合LLM評判者。過早將資源投入到複雜的自動評估會導致頻繁校準評估本身,反而減緩開發速度。
與規模評估者合作時,最大的挑戰來自邊界情況的判斷模糊。講者分享了一個真實案例:代理被明確指示「永不刪除法律免責聲明」,但在某些特殊情況下仍執行了刪除。如果僅看聚合統計的通過率,這類邏輯錯誤是不可見的。解決方案是三管齊下:第一,提供極為清晰的評分標準配合具體實例,讓評估者理解邊界;第二,要求評估者解釋評分理由;第三,檢查代理的思考過程(追蹤日誌),而非只看最終結果。此外,評估不應限於簡單的合格/不合格,應採多維度設計——對同一個廣告評估其準確度、品牌安全性、是否符合預期等,這樣能更準確指導代理改進的方向。
發布前的驗證流程同樣關鍵。講者提醒要進行消融實驗(A/B測試)理清模型性能的退化在哪裡、什麼程度的回歸是可接受的。重要的是關注模式而非孤立的運作——一個常見的陷阱是看到單個測試失敗就修改提示詞,但在非確定性系統中這樣做容易過度擬合。應該在黃金標準集中有多個例子來涵蓋某個模式,關注該模式的整體失敗率。同時需要定期用生產數據刷新測試集,投資線上評估以驗證系統在真實用戶場景中的實際表現。
團隊協作層面,明確的培訓和文檔同樣不可或缺。評估標準、評分指南、清晰的範例集需要提前定義,否則規模評估團隊會頻繁提問「這個情況怎麼評分」,導致大量被標記為「未知」的結果。講者建議儘早明確發布標準(如精確率/召回率閾值),這些指標對代理評估可能不同於傳統機器學習模型的精確率/召回率定義,需要特別說明。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


