KeyFrame內部研究專用

How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, YouTube Ads

AI Engineer·7月24日週五·19 min英文

三句話摘要

YouTube廣告團隊分享如何構建生產級的AI代理評估系統。 評估系統的核心是先用直觀小規模評估找出失敗模式,再逐步擴展到自動化和多維度評估,同時嚴格監控評估品質本身,才能有效指導AI代理的迭代改進。 評估體系的演進路徑:先從小規模的直觀評估開始(PM+核心團隊手動測試),只需幾個核心任務;隨著進度擴展到專業評估團隊、更大的黃金標準資料集,最後整合LLM評判者和人類評判者的混合模式。過早擴展自動化評估會導致頻繁的評估校準工作,反而拖累代理開發速度。

重點整理

重點
  • 1

    評估體系的演進路徑:先從小規模的直觀評估開始(PM+核心團隊手動測試),只需幾個核心任務;隨著進度擴展到專業評估團隊、更大的黃金標準資料集,最後整合LLM評判者和人類評判者的混合模式。過早擴展自動化評估會導致頻繁的評估校準工作,反而拖累代理開發速度。

  • 2

    評分標準的精確性決定執行質量:規模評估者最常遇到的問題是邊界情況的判斷不明確。必須提供極為清晰的評分標準配合具體範例,讓評估者理解什麼是合格、什麼是不合格,團隊內部對好案例要達成高度共識。詢問評估者「為什麼這樣評分」能挖掘代理的真實改進空間。

  • 3

    多維度評估比簡單的通過/失敗更有價值:不只看通過率,要從品牌安全、準確度、邏輯可追溯性等多個維度評估。檢查代理的思考過程(追蹤日誌)比只看最終結果更能找到問題根源;一個廣告可能在品牌安全上合格但準確度失格,這些細節指導代理的針對性改進。

  • 4

    發布前的嚴格驗證機制:需要進行消融實驗(A/B測試)理解模型退化在哪裡,明確定義可接受的回歸閾值。關鍵是關注模式而非孤立的運作——不因單個失敗例子改提示詞,而要確保在黃金標準集中有多個例子覆蓋該模式;持續用生產數據更新測試集,投資線上評估來驗證現實世界表現。

實用技巧與重點

乾貨
  • 評估系統的三層架構
  • 能力(代理的基礎LLM和工具優化)
  • 護欄(自我糾正機制、補救循環)
  • 評估(衡量現實世界表現)
  • 具體失敗案例
  • 代理被指示「禁止刪除法律免責聲明」,但在特定情況下仍刪除了。追蹤日誌顯示:代理檢測到免責聲明→決定刪除(違反指示)→實際執行刪除。單純看通過率無法發現此類邏輯錯誤
  • 多維度評估的維度
  • 廣告準確性(是否符合要求)
  • 品牌安全性(是否存在安全隱患)
  • 是否與預期相符
  • 這些維度可獨立評分而非單一合格/不合格判定
  • 評估演進階段
  • 初期:直觀評估(數個核心任務)
  • 成長期:專業評估團隊、黃金標準資料集擴大
  • 成熟期:人類評估+LLM評判者、監控一致性率、採樣驗證
  • 質量控制機制
  • 樣本抽查(檢查邏輯背後的推理)
  • 監控人類vs.LLM評判的分歧率
  • 定期用生產數據刷新測試集
  • 設定明確的發布標準(精確率/召回率閾值等)

結論

結論

評估系統的核心是先用直觀小規模評估找出失敗模式,再逐步擴展到自動化和多維度評估,同時嚴格監控評估品質本身,才能有效指導AI代理的迭代改進。

完整解析

詳細

構建一套有效的AI代理評估系統是生產環境部署的關鍵瓶頸。YouTube廣告團隊在開發圖像和視頻廣告生成代理時發現,生成式AI的非確定性特質使得無法完全保證其輸出質量,因此需要建立大規模衡量機制來確保產品達到預期效果。代理的可靠性三角形由能力、護欄和評估三要素支撐,其中評估是理解代理在真實場景中如何表現的關鍵。

講者強調一個看似違反直覺但極為有效的做法:不要一開始就構建完全自動化的評估系統。相反,應該從小規模的直觀評估開始。在初期,由PM和核心體驗團隊手動測試幾個核心任務,即使這種方法無法規模化。這樣做的好處是能快速理解代理的失敗模式,進行徹底的架構改進而不被評估流程卡住。一旦代理的基礎穩固,才逐步擴展到專業評估團隊、更大的黃金標準資料集,最後才整合LLM評判者。過早將資源投入到複雜的自動評估會導致頻繁校準評估本身,反而減緩開發速度。

與規模評估者合作時,最大的挑戰來自邊界情況的判斷模糊。講者分享了一個真實案例:代理被明確指示「永不刪除法律免責聲明」,但在某些特殊情況下仍執行了刪除。如果僅看聚合統計的通過率,這類邏輯錯誤是不可見的。解決方案是三管齊下:第一,提供極為清晰的評分標準配合具體實例,讓評估者理解邊界;第二,要求評估者解釋評分理由;第三,檢查代理的思考過程(追蹤日誌),而非只看最終結果。此外,評估不應限於簡單的合格/不合格,應採多維度設計——對同一個廣告評估其準確度、品牌安全性、是否符合預期等,這樣能更準確指導代理改進的方向。

發布前的驗證流程同樣關鍵。講者提醒要進行消融實驗(A/B測試)理清模型性能的退化在哪裡、什麼程度的回歸是可接受的。重要的是關注模式而非孤立的運作——一個常見的陷阱是看到單個測試失敗就修改提示詞,但在非確定性系統中這樣做容易過度擬合。應該在黃金標準集中有多個例子來涵蓋某個模式,關注該模式的整體失敗率。同時需要定期用生產數據刷新測試集,投資線上評估以驗證系統在真實用戶場景中的實際表現。

團隊協作層面,明確的培訓和文檔同樣不可或缺。評估標準、評分指南、清晰的範例集需要提前定義,否則規模評估團隊會頻繁提問「這個情況怎麼評分」,導致大量被標記為「未知」的結果。講者建議儘早明確發布標準(如精確率/召回率閾值),這些指標對代理評估可能不同於傳統機器學習模型的精確率/召回率定義,需要特別說明。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。