KeyFrame內部研究專用

Don't Ship Skills Without Evals — Philipp Schmid, Google DeepMind

AI Engineer·7月14日週二·21 min英文

三句話摘要

為什麼 AI 代理的技能必須搭配評估機制才能上線——缺乏評估會導致模型行為無法控制。 技能需要評估不是選項而是必須,唯有通過 5-20 個包含正反面案例的測試,才能確保代理行為在生產環境中符合預期。 能力技能與偏好技能有本質區別:能力技能教導模型新能力(隨模型進步可淘汰),偏好技能編碼公司特定工作流(需永久保護),後者尤其必須配備評估機制以防模型更新導致性能下降。

重點整理

重點
  • 1

    能力技能與偏好技能有本質區別:能力技能教導模型新能力(隨模型進步可淘汰),偏好技能編碼公司特定工作流(需永久保護),後者尤其必須配備評估機制以防模型更新導致性能下降。

  • 2

    技能觸發方式影響設計策略:模型觸發型技能需要精準的描述讓模型判斷何時使用;用戶觸發型技能可承受較長的描述與複雜度,不應內建於模型上下文。建立面向消費者的代理時,只能仰賴模型觸發機制。

  • 3

    分層資訊揭示是關鍵:簡短描述(2 句話)付出固定的 token 成本,應只包含「何時用」與「如何用」;詳細說明放在技能主體;深層資訊分別放在參考檔案中(如多雲部署需拆成 AWS、Google Cloud、Azure 三份參考檔),讓模型自主探索所需細節。

  • 4

    評估必須涵蓋反面案例:50% 的失敗源於技能描述過於模糊導致過度觸發,需明確定義「不使用」的邊界條件,並用 5 個正面 + 5 個反面測試案例驗證。

實用技巧與重點

乾貨
  • Skills Bench 基準測試:涵蓋 100+ 任務,評估過多款開源與閉源模型,技能平均改善性能 15%
  • 技能文件大小限制:應在 500 行以內
  • 評估規模建議:至少 5-20 個測試案例;Google DeepMind 的 Gemini Interactions API 技能用 117 個測試案例達到 90% 有效率
  • 測試語言:支援 TypeScript 和 Python
  • 驗證方式:正規表達式檢查(檢驗 SDK、模型版本、方法名)、bash 命令追蹤、LLM-as-a-judge 評分
  • 測試環境:隔離執行空間,3-6 次試驗以測量可靠性,跨不同代理框架測試(Cursor、Codeex、Claude Code、anti-gravity 等)
  • No-ops 清理:移除「使程式碼易讀」等無實質改變行為的指令,減少冗餘 token 成本
  • 評估工作流:JSON 或 YAML 測試集合 + Python 指令碼驅動代理執行 + 結果驗證,每次技能修改時自動運行

結論

結論

技能需要評估不是選項而是必須,唯有通過 5-20 個包含正反面案例的測試,才能確保代理行為在生產環境中符合預期。

完整解析

詳細

AI 代理的技能(Skills)是提升模型效能的強大工具,但業界普遍缺乏評估機制。根據 Skills Bench 的分析,GitHub 上超過 50,000 個公開技能幾乎都未配備評估,多數由 AI 自動生成且未經實測。這造成一個困境:當代理執行失敗時,團隊無法判斷究竟是技能設計不良,還是任務本身超出模型能力。

講者 Fulip 強調,技能分為兩類。能力技能教導模型新能力——例如追蹤日誌、建立 React 應用——隨著基礎模型改進,這類技能逐漸變得多餘;偏好技能則編碼公司特定的工作流與語言風格,是長期資產,必須以評估保護。數據顯示,人工編寫的技能比 AI 自動生成的技能效果好 15%,後者甚至可能降低性能。

技能的關鍵在於分層揭示。最外層是簡短的 2 句描述——這部分被納入每次模型呼叫的上下文,token 成本固定,應只說明「為什麼用」與「怎麼用」。第二層是技能主體的詳細指令。最深層則是參考檔案,讓模型在需要時主動探索。良好的技能會避免冗長陳述,改用指令式描述(「使用 Interactions API 處理 Java 應用」,而非「Interactions API 被推薦用於多聊天互動因為它處理會話狀態」)。

為了驗證技能有效性,講者推薦先寫 5-20 個測試案例:5 個測試正面路徑(應該觸發技能),5 個測試反面路徑(不應觸發)。Google DeepMind 為新的 Gemini Interactions API 技能編寫了 117 個測試案例,結合真實使用者軌跡與合成測試資料,最終達到 90% 的有效率。評估可使用簡單的正規表達式檢查(驗證 SDK、模型版本)、bash 命令追蹤,或針對複雜邏輯使用 LLM-as-a-judge。重點是在隔離環境中執行 3-6 次試驗,並跨不同代理框架(Cursor、Claude Code 等)進行測試。

另一個容易被忽視的細節是「no-ops」——那些不改變模型行為的冗餘指令。AI 生成的技能特別容易包含這類廢句,例如「編寫易讀程式碼」。移除它們能顯著節省 token 成本。最後,評估不只是把舊技能丟掉;應持續運行含技能與不含技能的測試,當模型在無技能情況下仍達目標時,才是技能真正可以退役的時刻。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。