KeyFrame內部研究專用

Building Great Agent Skills: The Missing Manual

AI Engineer·6月29日週一·20 min英文

三句話摘要

如何撰寫優質AI技能:評估框架與實踐指南。 優質技能的核心不在功能豐富,而在於用一致的主導詞、清晰的結構分支和無情的精簡,讓代理準確理解並執行你想要的行為。 觸發方式的成本權衡:用戶觸發技能(disable model invocation)不會在代理上下文加入描述,降低context load但增加用戶需要記住的技能數;模型觸發技能讓代理自動發現但每個描述都吃token。兩者都有代價,講者偏好用戶觸發以避免代理不遵循上下文指針的不可預測性。

重點整理

重點
  • 1

    觸發方式的成本權衡:用戶觸發技能(disable model invocation)不會在代理上下文加入描述,降低context load但增加用戶需要記住的技能數;模型觸發技能讓代理自動發現但每個描述都吃token。兩者都有代價,講者偏好用戶觸發以避免代理不遵循上下文指針的不可預測性。

  • 2

    結構設計:步驟+參考分離:技能由步驟(流程)和參考資料(支持信息)組成,分支專用的參考資料應隱藏在外部檔案,只在skill.md中放入所有分支都需要的內容。這樣能保持主檔案精簡,同時保留完整資訊。

  • 3

    用主導詞精準指導:在技能文本中一致重複某些高含義詞彙(如「垂直切片」),代理會在推理過程中採納並重複這些詞,從而改變行為方式。這比冗長指示更有效。

  • 4

    技能分割增加專注度:當某個步驟需要更多工作時,將其分離為獨立技能,讓代理只看到當前步驟、隱藏未來目標,能大幅提升該步驟的投入程度。

實用技巧與重點

乾貨
  • 技能四層框架
  • 觸發(Trigger):決定用戶觸發或模型觸發
  • 結構(Structure):由步驟+參考資料組成,分支資料用上下文指針外部連結
  • 指導(Steering):主導詞一致性、確保代理做足功課
  • 精簡(Pruning):移除重複、沉積物、無操作內容
  • 技能構成
  • 描述文檔(可選,模型觸發時可見)
  • skill.md檔案(主內容)
  • 外部參考檔案(分支專用,透過上下文指針連結)
  • 主導詞概念
  • 例子:「垂直切片」代替「別層層編碼」
  • 效果:代理在推理追蹤中會重複並採用這些詞彙
  • 驗證方式:查看reasoning traces是否出現該詞
  • 技能分割案例
  • 原始:plan mode(ask clarifying questions → create plan)
  • 改進:grill-with-docs(獨立技能)→ 2PRD(獨立技能)
  • 效果:隱藏未來步驟,增加當前步驟的工作量
  • 精簡失誤三種
  • 重複:同一資料在多處出現,無單一真實來源
  • 沉積物(sediment):多人協作積累的不相關內容
  • 無操作(no-ops):刪除後代理行為不變的文本
  • 檢驗方法
  • 刪除測試:移除段落後,代理表現是否改變
  • 講者技巧:使用主導詞compacting、刪除測試、確保單一真實來源
  • 外部資源
  • 技能倉庫:Matt Pocock's skills(Matpokot skills,業界最流行的工程技能集之一)
  • 新增技能:「writing great skills」(可從倉庫下載使用)
  • 比較對象:Superpowers(主要為模型觸發技能)
  • Newsletter:aihero.dev
  • 計畫:發布AI coding crash course

結論

結論

優質技能的核心不在功能豐富,而在於用一致的主導詞、清晰的結構分支和無情的精簡,讓代理準確理解並執行你想要的行為。

完整解析

詳細

開發者正經歷「技能地獄」——雖然大量優質技能免費可用,但缺乏判斷標準和整合知識,導致無法獲得技能本身承諾的效益。這個問題在組織層級更嚴重——企業不知道如何從營運流程構建優質技能。講者因感到責任感(其技能倉庫是業界最受歡迎之一),決定分享一套技能評估框架。

框架的核心是四個層級。首先是觸發方式——技能有兩種被調用的方式。用戶可以手動呼叫任何技能(如 `/code-review`),但技能也可透過描述文檔被代理自動發現和觸發。這分別稱為用戶觸發和模型觸發技能。選擇時需權衡:模型觸發技能在代理上下文中加入描述,每個技能都消耗tokens且佔用代理注意力;用戶觸發技能避免這些,但用戶需記住更多技能。講者偏好用戶觸發,因為它避免了模型可能忽視上下文指針的不可預測性,儘管這增加了用戶認知負擔。

結構設計分為步驟和參考資料兩單位。步驟是逐步程序,參考資料是支持資訊。關鍵洞察是保持skill.md檔案最小化——精簡技能更易維護、審計,每刪除一個詞都節省tokens。當技能有多個使用分支時,只在某些分支中需要的參考資料應隱藏在外部檔案,透過上下文指針連結。例如domain modeling技能有2-3個分支(更新詞彙表、建立架構決策記錄、或都不做),只在特定分支使用的模板應外部存放。

指導方法的核心技巧是主導詞——那些能在小空間內承載大量意義的詞彙。舉例,不寫「確保建立一個小切片先工作再擴展」,而是貫穿技能使用「垂直切片」這個業界已知概念。代理會在推理過程中重複和採用這些詞,從而改變行為——你可在reasoning traces中看到它說「我們做為一個薄垂直切片」。另一個技巧是技能分割——當某步驟(如澄清問題)需要更多工作但代理因看到最終目標而倉促時,將其提取為獨立技能。這樣代理只看到當前步驟,不被未來目標所誘,大幅增加投入。

精簡階段是三類失誤檢查。首先是重複——同一資訊在多處出現無單一真實來源。其次是沉積物——多人協作時累積的不相關或過時內容。最後是無操作——看似重要但刪除後代理行為不變的文本。講者用刪除測試識別:移除某段落後代理是否仍表現相同,若是則該段無用。講者技能保持精簡的祕訣正是這些技巧:使用主導詞壓縮文本、透過刪除測試驗證、確保單一真實來源、避免沉積物。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。