KeyFrame內部研究專用

Skills are new features: Building Skill-Centric Harness — Yogendra Miraje, FactSet

AI Engineer·7月29日週三·17 min英文

三句話摘要

Anthropic skills 在 agentic products 中的應用架構與企業級 skill library 治理。 Skills 是 agentic products 的新特徵系統,工程師角色從交付特徵轉向交付 harnesses(平台),而企業級規模下 skill library 的治理——從路由信號的精心設計到訪問控制邊界的維護——是產品可靠性與可擴展性不可或缺的基礎。 Skills 是 agentic products 的新特徵。傳統產品以 UI 介面驅動,現代 products 將 agent 置於核心位置。此時特徵應該住在哪裡?答案是 skills——Prompts 定義 agent 是誰、Tools 定義它能連接什麼、Skills 定義如何完成任務。因此 skills 本質上取代了按鈕、下拉選單與表單,成為承載業務邏輯的容器。

重點整理

重點
  • 1

    Skills 是 agentic products 的新特徵。傳統產品以 UI 介面驅動,現代 products 將 agent 置於核心位置。此時特徵應該住在哪裡?答案是 skills——Prompts 定義 agent 是誰、Tools 定義它能連接什麼、Skills 定義如何完成任務。因此 skills 本質上取代了按鈕、下拉選單與表單,成為承載業務邏輯的容器。

  • 2

    描述是路由信號,不是文檔。Agent 通過 skill name 與 description 判斷何時調用特定 skill。描述必須對齐真實用戶請求措辭(如在描述中寫明「僅當用戶要求 PDF 報告時使用」),而非技術實現細節。描述之間也要保持清晰差異化,否則 agent 會混淆。

  • 3

    模型升級後必須重新執行評估。Skills 不是靜態文檔,而是「與模型版本化的合約」。不同模型對 skill 指令的理解差異很大——實例中新模型過分關注指令開頭而忽視結尾的關鍵指令,導致原本正常的 skills 失效。未經評估驗證的 skills 只是一廂情願。

  • 4

    企業規模下需要五層治理:Admission(skill 應否存在或併入現有 skill)、Ownership(由對應業務團隊維護,類同 code owners)、Boundaries(工具訪問控制邊界)、Lifecycle(語義版本化、棄用警告、變更日誌)、Coherence(定期審計保持一致性)。治理無需成為紅帶瓶頸,而應通過自動化搭配人工介入實現。

實用技巧與重點

乾貨
  • Skill 結構與最小實現:
  • Skill.md 包含 frontmatter(name、description)與 body(業務邏輯、檔案/腳本引用)
  • 啟用 skills 的最少要求:skill registry + system prompt + file read tool
  • 若需執行腳本則另加:Bash 或代碼沙箱環境
  • 路由與發現機制:
  • Progressive disclosure:system prompt 中僅放 name 和 description,agent 按需查看完整指令
  • 描述中的觸發詞決定調用(例:描述提及「PDF」就成為路由信號)
  • 組織原則:
  • 按用戶意圖而非數據模型組織(例:用「earning preparation」而非「estimate analysis」、「pre-market briefing」而非「news + analysis」)
  • 按實際使用場景迭代(從窄用例開始,隨發現逐步重構)
  • 規模擴展與治理:
  • 10+ skills:開始使用 shortlisting(embeddings similarity search 或小型模型過濾)
  • 100+ skills:實施層級結構、元數據過濾、governance 框架
  • Lifecycle:semantic versioning + deprecation warnings + changelog
  • 評估策略:每次模型升級都必須重新執行 evals
  • 企業治理五層面:
  • Admission(自動門禁 + 人工審核,類同 PR review)
  • Ownership(命名 skill owners,類同 code owners)
  • Boundaries(工具白名單與訪問控制)
  • Lifecycle(版本管理與棄用流程)
  • Coherence(定期審計與驗證)

結論

結論

Skills 是 agentic products 的新特徵系統,工程師角色從交付特徵轉向交付 harnesses(平台),而企業級規模下 skill library 的治理——從路由信號的精心設計到訪問控制邊界的維護——是產品可靠性與可擴展性不可或缺的基礎。

完整解析

詳細

在過去一年,skills 的角色從講者去年介紹的「blueprints」演進至 Anthropic 開源並正式推出的完整功能。Blueprints 本質上是一套簡單步驟交給 agents,使其無需每次都重新探索路徑;而 skills 則是這一概念的標準化、生產級實現。既然 Anthropic 已開源 skills,FACTSET 決定完全採用而非維護自有標準,這也激發了講者構建「skill-centric agentic products」的思路。

在傳統產品中,使用者通過導航 UI 介面(屏幕、按鈕、表單、儀表板)與系統互動。但現代的 agentic products 正在翻轉這一模式——agent 成為產品的主要介面,代替使用者做決策。當 agent 成為核心時,一個自然的問題浮現:特徵應該住在哪裡?透過「誰、什麼、如何」的框架可以清晰回答:Prompts 定義 agent 是誰、Tools 定義它能連接什麼、Skills 定義如何完成任務。Skills 實質上是「一種標準化的教 AI agents 如何將特定任務做好的方法」,可以簡單如純 markdown,也可以複雜到包含多個檔案與可執行腳本的引用。

實現 skills 支持的門檻遠低於想像。最少只需三樣:skills registry(一個集合,包含每個 skill 的名稱、描述與路徑)、將 registry 整合進 system prompt、基礎的檔案讀取工具。如果 skills 需要執行腳本,就加上 Bash 或沙箱。Agent 通過「progressive disclosure」機制發現 skills——system prompt 中僅放入 name 和 description,當 agent 決定調用某個 skill 時,才會深入查看完整的業務邏輯指令。

實踐中最關鍵的洞察來自描述的作用。Skill 描述不是文檔,而是路由信號。以「報告 HTML」與「報告 PDF」兩個 skills 為例,儘管功能相似,但當描述中明確寫著「僅當用戶要求 PDF 報告時使用此 skill」時,「PDF」這個詞就成了觸發信號,引導 agent 選擇正確的 skill。這意味著描述必須對齐真實用戶請求的措辭,而非技術實現細節,且要保持足夠的區分度。另一個深刻的教訓來自模型升級的經歷。更新到新版本模型後,原本正常的 skills 突然失效,儘管 skill 代碼完全未改動。根本原因是新模型對指令的理解方式改變了——它過分關注 skill 的開頭,忽視了結尾的關鍵指令。這個事件揭示了一個根本真理:skills 不是靜態文檔,而是「與模型版本化的合約」。每次升級模型都必須重新執行評估(evals),沒有評估的 skills 不過是願景清單。

當 skills 數量增長時,簡單的 system prompt 方法會失效。超過 10 個 skills 時,應考慮 shortlisting 機制——例如基於 embeddings 的相似度搜索或用較小的模型過濾應添加到 prompt 中的 skills。達到數百個 skills 時,必須引入層級結構、元數據過濾與完整的治理框架。企業級 skill library 治理包含五個方面,每個回答一個核心問題:Admission 決定某個 skill 是否應該存在或應該併入現有 skill;Ownership 則由業務團隊維護,類同代碼中的 code owners 概念;Boundaries 通過工具白名單確保訪問控制邊界清晰;Lifecycle 則通過語義版本化、棄用警告與變更日誌管理 skill 的生命週期;Coherence 則通過定期審計確保整個 library 的一致性與搜尋能力。這些做法借鑑自數十年驗證過的代碼治理實踐,無需成為瓶頸,而是通過自動化搭配人工介入來平衡效率與質量。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。