KeyFrame內部研究專用

Skills are the New SDKs - Elvin Aghammadzada, DataRobot

AI Engineer·7月20日週一·26 min英文

三句話摘要

技能(Skills)如何通過上下文工程成為企業 AI 代理的核心架構,以及如何打造「流暢模式」而非「摩擦模式」的平台競爭策略。 技能透過漸進式 metadata 披露與智能上下文工程,根本性解決了大模型性能隨上下文擴展而衰退的瓶頸,成為企業 AI 代理平台從「摩擦模式」轉向「流暢模式」競爭的核心戰略工具。 上下文腐蝕的真實邊界:LLM 宣稱無限上下文窗口是誤導。研究表明當上下文使用達 25% 時性能即開始下降。隨著對話累積、工具調用失敗的錯誤信息殘留,上下文自我吞噬,最終讓最新模型表現如舊模型。

重點整理

重點
  • 1

    上下文腐蝕的真實邊界:LLM 宣稱無限上下文窗口是誤導。研究表明當上下文使用達 25% 時性能即開始下降。隨著對話累積、工具調用失敗的錯誤信息殘留,上下文自我吞噬,最終讓最新模型表現如舊模型。

  • 2

    代理最優工作區域是 40%:系統指令、工具描述、MCP 連接、用戶輸入等組合占用上下文 40% 時表現最佳,超過 40% 進入「愚蠢區域」。關鍵是在正確時刻用正確信息填充上下文,而非塞入所有資訊。

  • 3

    技能創造「流暢模式」商業邏輯:傳統 SaaS 靠製造摩擦讓用戶難以離開;技能則打造每次使用都更優的體驗,累積形成難以切換的粘性。核心是將「意圖到結果的摩擦最小化」作為平台差異化。

  • 4

    技能與 MCP 互補而非競爭:技能擅長改變代理行為、支持自我修改、漸進式披露;MCP 提供隔離、資源管理、外部數據訪問。技能可包裝 MCP server,避免一次性加載所有工具定義。

實用技巧與重點

乾貨
  • 性能阈值與數據:
  • 上下文腐蝕阈值:25% 使用率
  • 代理最優性能范围:40% 上下文
  • 文檔流量成長:編碼代理訪問文檔流量從 10% 增至 50%(年增長)
  • 技能三層結構與 Token 消耗:
  • 前置部分(XML 索引):<100 token,運行時加載
  • 正文部分(Markdown):<5,000 token,啟動時按需加載
  • 腳本部分:可執行或示範代碼
  • 技能 vs MCP 開銷對比:
  • 15 個 MCP 服務器:工具定義消耗 >100,000 token/會話
  • 相同功能通過技能實現:減少 10 倍開銷
  • 生態系統規模:
  • 平台支持數:26 個(Claude Code、Codex、GitHub Copilot、Gemini CLI 等)
  • 技能存量:數十萬種已發布
  • 市場平台:多個技能交易市場已成立
  • Open Agent 開源庫:GitHub 星標數超過 Webpack 與 React
  • 代理設計轉變:
  • 傳統:為每個用例構建獨立代理
  • 新模式:一個通用代理引擎 + 領域特定技能組合

結論

結論

技能透過漸進式 metadata 披露與智能上下文工程,根本性解決了大模型性能隨上下文擴展而衰退的瓶頸,成為企業 AI 代理平台從「摩擦模式」轉向「流暢模式」競爭的核心戰略工具。

完整解析

詳細

講座揭開了一個廣泛存在的誤解:當代語言模型雖然宣稱擁有百萬、五百萬甚至無限上下文窗口,但這些承諾實際上誤導了開發者對 RAG 和 MCP 的理解。開發者傾向於假設上下文越長越好,可以把整個檔案清單放進去,期望模型自動找到答案。然而,学术研究(《上下文腐蚀》論文)證明了完全相反的結論:當上下文窗口使用達到 25% 時,模型性能就開始下降。這個現象在實際開發中尤為明顯——隨著對話深入、測試輸入的累積、工具調用失敗時殘留的錯誤訊息,上下文幾乎被自己吞噬,導致最新的模型最後表現得像一個糟糕的舊模型。

講者因此引入了「上下文工程」作為系統性解決方案。核心思想是在正確時刻最小化流入 LLM 的信息量,進而能在正確時刻以正確方式用正確信息填充上下文。典型代理包含多個信息源:系統指令、內建工具、MCP 連接、用戶提示。經驗表明,這些元素加起來占用上下文的 40% 時,代理表現最好。超過 40% 後就進入「愚蠢區域」——即使掌握 100% 的上下文信息,性能也會急劇下降。這解釋了為什麼添加越來越多的工具或 MCP 服務器往往適得其反。

技能(Skills)是解決這個問題的關鍵創新。與 MCP 服務器一次性加載所有工具定義不同,技能採用「漸進式披露」策略。其三層構造設計精妙:前置部分是 XML 格式索引(少於 100 個 token),在運行時加載到系統提示,彷彿資料庫中的索引,幫助 LLM 快速搜尋;正文是 Markdown 文檔(通常少於 5,000 個 token),在啟動時加載,當 LLM 判斷需要該技能時才完整載入;腳本部分是可執行或示範代碼,按需運行。實際效果是,15 個 MCP 服務器會消耗超過 10 萬個 token 的工具定義,相同功能通過技能實現則能減少 10 倍開銷。

從戰略層面看,講者分析了企業 AI 的演進方向。傳統 SaaS 時代的競爭邏輯是製造「摩擦」——通過高轉換成本、集成深度、數據鎖定讓用戶難以離開。但技能正在創造完全不同的「流暢模式」生態。這裡的邏輯是反向的:每增加一項設計精良的技能,都會提升平台的使用體驗。隨著體驗累積,用戶因為愛上這個平台而不想離開。體驗的本質是「意圖到結果之間的摩擦最小化」,技能使得平台能將這種體驗差異作為核心商業邏輯,並且衍生出新的評估維度——「可教性」(Learnability):新用戶或代理框架首次接觸時,能否在秒級內掌握並應用技能。

講座強調了技能與 MCP 的互補性而非競爭。MCP 適合隔離關鍵流程、管理外部數據訪問(如醫療記錄)或處理需要專用資源的任務。技能則與代理緊密集成,支持自我修改——代理可根據使用經驗更新自己的技能。開源項目 Open Agent 生動展示了這種潛力:一個僅有約 10 個工具的編碼代理,透過技能實現了自我修復、自我編寫技能、自我擴展能力。這改變了企業解決方案的設計思路:不必為每個用例構建獨立代理,只需構建一個優秀的通用代理引擎,然後在其上層堆砌領域特定技能。

最後,講者強調質量控制至關重要。雖然 LLM 可以生成技能,但研究表明 AI 生成的技能實際上損害模型性能——它消耗更多 token、增加推理時間,反而沒有幫助。當前 26 個平台支持技能、數十萬種技能已發佈,但市場缺乏驗證機制——這讓人想起 10 年前的 NPM 野蠻生長期。技能需要像軟體一樣經歷版本控制、評估、測試的嚴格流程,唯有如此才能編寫出真正優秀的技能。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。