Don't Ship Skills Without Evals — Philipp Schmid, Google DeepMind
三句話摘要
為什麼 AI 代理的技能必須搭配評估機制才能上線——缺乏評估會導致模型行為無法控制。 技能需要評估不是選項而是必須,唯有通過 5-20 個包含正反面案例的測試,才能確保代理行為在生產環境中符合預期。 能力技能與偏好技能有本質區別:能力技能教導模型新能力(隨模型進步可淘汰),偏好技能編碼公司特定工作流(需永久保護),後者尤其必須配備評估機制以防模型更新導致性能下降。
重點整理
重點- 1
能力技能與偏好技能有本質區別:能力技能教導模型新能力(隨模型進步可淘汰),偏好技能編碼公司特定工作流(需永久保護),後者尤其必須配備評估機制以防模型更新導致性能下降。
- 2
技能觸發方式影響設計策略:模型觸發型技能需要精準的描述讓模型判斷何時使用;用戶觸發型技能可承受較長的描述與複雜度,不應內建於模型上下文。建立面向消費者的代理時,只能仰賴模型觸發機制。
- 3
分層資訊揭示是關鍵:簡短描述(2 句話)付出固定的 token 成本,應只包含「何時用」與「如何用」;詳細說明放在技能主體;深層資訊分別放在參考檔案中(如多雲部署需拆成 AWS、Google Cloud、Azure 三份參考檔),讓模型自主探索所需細節。
- 4
評估必須涵蓋反面案例:50% 的失敗源於技能描述過於模糊導致過度觸發,需明確定義「不使用」的邊界條件,並用 5 個正面 + 5 個反面測試案例驗證。
實用技巧與重點
乾貨- Skills Bench 基準測試:涵蓋 100+ 任務,評估過多款開源與閉源模型,技能平均改善性能 15%
- 技能文件大小限制:應在 500 行以內
- 評估規模建議:至少 5-20 個測試案例;Google DeepMind 的 Gemini Interactions API 技能用 117 個測試案例達到 90% 有效率
- 測試語言:支援 TypeScript 和 Python
- 驗證方式:正規表達式檢查(檢驗 SDK、模型版本、方法名)、bash 命令追蹤、LLM-as-a-judge 評分
- 測試環境:隔離執行空間,3-6 次試驗以測量可靠性,跨不同代理框架測試(Cursor、Codeex、Claude Code、anti-gravity 等)
- No-ops 清理:移除「使程式碼易讀」等無實質改變行為的指令,減少冗餘 token 成本
- 評估工作流:JSON 或 YAML 測試集合 + Python 指令碼驅動代理執行 + 結果驗證,每次技能修改時自動運行
結論
結論“技能需要評估不是選項而是必須,唯有通過 5-20 個包含正反面案例的測試,才能確保代理行為在生產環境中符合預期。”
完整解析
詳細AI 代理的技能(Skills)是提升模型效能的強大工具,但業界普遍缺乏評估機制。根據 Skills Bench 的分析,GitHub 上超過 50,000 個公開技能幾乎都未配備評估,多數由 AI 自動生成且未經實測。這造成一個困境:當代理執行失敗時,團隊無法判斷究竟是技能設計不良,還是任務本身超出模型能力。
講者 Fulip 強調,技能分為兩類。能力技能教導模型新能力——例如追蹤日誌、建立 React 應用——隨著基礎模型改進,這類技能逐漸變得多餘;偏好技能則編碼公司特定的工作流與語言風格,是長期資產,必須以評估保護。數據顯示,人工編寫的技能比 AI 自動生成的技能效果好 15%,後者甚至可能降低性能。
技能的關鍵在於分層揭示。最外層是簡短的 2 句描述——這部分被納入每次模型呼叫的上下文,token 成本固定,應只說明「為什麼用」與「怎麼用」。第二層是技能主體的詳細指令。最深層則是參考檔案,讓模型在需要時主動探索。良好的技能會避免冗長陳述,改用指令式描述(「使用 Interactions API 處理 Java 應用」,而非「Interactions API 被推薦用於多聊天互動因為它處理會話狀態」)。
為了驗證技能有效性,講者推薦先寫 5-20 個測試案例:5 個測試正面路徑(應該觸發技能),5 個測試反面路徑(不應觸發)。Google DeepMind 為新的 Gemini Interactions API 技能編寫了 117 個測試案例,結合真實使用者軌跡與合成測試資料,最終達到 90% 的有效率。評估可使用簡單的正規表達式檢查(驗證 SDK、模型版本)、bash 命令追蹤,或針對複雜邏輯使用 LLM-as-a-judge。重點是在隔離環境中執行 3-6 次試驗,並跨不同代理框架(Cursor、Claude Code 等)進行測試。
另一個容易被忽視的細節是「no-ops」——那些不改變模型行為的冗餘指令。AI 生成的技能特別容易包含這類廢句,例如「編寫易讀程式碼」。移除它們能顯著節省 token 成本。最後,評估不只是把舊技能丟掉;應持續運行含技能與不含技能的測試,當模型在無技能情況下仍達目標時,才是技能真正可以退役的時刻。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


