Skills are the New SDKs - Elvin Aghammadzada, DataRobot
三句話摘要
技能(Skills)如何通過上下文工程成為企業 AI 代理的核心架構,以及如何打造「流暢模式」而非「摩擦模式」的平台競爭策略。 技能透過漸進式 metadata 披露與智能上下文工程,根本性解決了大模型性能隨上下文擴展而衰退的瓶頸,成為企業 AI 代理平台從「摩擦模式」轉向「流暢模式」競爭的核心戰略工具。 上下文腐蝕的真實邊界:LLM 宣稱無限上下文窗口是誤導。研究表明當上下文使用達 25% 時性能即開始下降。隨著對話累積、工具調用失敗的錯誤信息殘留,上下文自我吞噬,最終讓最新模型表現如舊模型。
重點整理
重點- 1
上下文腐蝕的真實邊界:LLM 宣稱無限上下文窗口是誤導。研究表明當上下文使用達 25% 時性能即開始下降。隨著對話累積、工具調用失敗的錯誤信息殘留,上下文自我吞噬,最終讓最新模型表現如舊模型。
- 2
代理最優工作區域是 40%:系統指令、工具描述、MCP 連接、用戶輸入等組合占用上下文 40% 時表現最佳,超過 40% 進入「愚蠢區域」。關鍵是在正確時刻用正確信息填充上下文,而非塞入所有資訊。
- 3
技能創造「流暢模式」商業邏輯:傳統 SaaS 靠製造摩擦讓用戶難以離開;技能則打造每次使用都更優的體驗,累積形成難以切換的粘性。核心是將「意圖到結果的摩擦最小化」作為平台差異化。
- 4
技能與 MCP 互補而非競爭:技能擅長改變代理行為、支持自我修改、漸進式披露;MCP 提供隔離、資源管理、外部數據訪問。技能可包裝 MCP server,避免一次性加載所有工具定義。
實用技巧與重點
乾貨- 性能阈值與數據:
- 上下文腐蝕阈值:25% 使用率
- 代理最優性能范围:40% 上下文
- 文檔流量成長:編碼代理訪問文檔流量從 10% 增至 50%(年增長)
- 技能三層結構與 Token 消耗:
- 前置部分(XML 索引):<100 token,運行時加載
- 正文部分(Markdown):<5,000 token,啟動時按需加載
- 腳本部分:可執行或示範代碼
- 技能 vs MCP 開銷對比:
- 15 個 MCP 服務器:工具定義消耗 >100,000 token/會話
- 相同功能通過技能實現:減少 10 倍開銷
- 生態系統規模:
- 平台支持數:26 個(Claude Code、Codex、GitHub Copilot、Gemini CLI 等)
- 技能存量:數十萬種已發布
- 市場平台:多個技能交易市場已成立
- Open Agent 開源庫:GitHub 星標數超過 Webpack 與 React
- 代理設計轉變:
- 傳統:為每個用例構建獨立代理
- 新模式:一個通用代理引擎 + 領域特定技能組合
結論
結論“技能透過漸進式 metadata 披露與智能上下文工程,根本性解決了大模型性能隨上下文擴展而衰退的瓶頸,成為企業 AI 代理平台從「摩擦模式」轉向「流暢模式」競爭的核心戰略工具。”
完整解析
詳細講座揭開了一個廣泛存在的誤解:當代語言模型雖然宣稱擁有百萬、五百萬甚至無限上下文窗口,但這些承諾實際上誤導了開發者對 RAG 和 MCP 的理解。開發者傾向於假設上下文越長越好,可以把整個檔案清單放進去,期望模型自動找到答案。然而,学术研究(《上下文腐蚀》論文)證明了完全相反的結論:當上下文窗口使用達到 25% 時,模型性能就開始下降。這個現象在實際開發中尤為明顯——隨著對話深入、測試輸入的累積、工具調用失敗時殘留的錯誤訊息,上下文幾乎被自己吞噬,導致最新的模型最後表現得像一個糟糕的舊模型。
講者因此引入了「上下文工程」作為系統性解決方案。核心思想是在正確時刻最小化流入 LLM 的信息量,進而能在正確時刻以正確方式用正確信息填充上下文。典型代理包含多個信息源:系統指令、內建工具、MCP 連接、用戶提示。經驗表明,這些元素加起來占用上下文的 40% 時,代理表現最好。超過 40% 後就進入「愚蠢區域」——即使掌握 100% 的上下文信息,性能也會急劇下降。這解釋了為什麼添加越來越多的工具或 MCP 服務器往往適得其反。
技能(Skills)是解決這個問題的關鍵創新。與 MCP 服務器一次性加載所有工具定義不同,技能採用「漸進式披露」策略。其三層構造設計精妙:前置部分是 XML 格式索引(少於 100 個 token),在運行時加載到系統提示,彷彿資料庫中的索引,幫助 LLM 快速搜尋;正文是 Markdown 文檔(通常少於 5,000 個 token),在啟動時加載,當 LLM 判斷需要該技能時才完整載入;腳本部分是可執行或示範代碼,按需運行。實際效果是,15 個 MCP 服務器會消耗超過 10 萬個 token 的工具定義,相同功能通過技能實現則能減少 10 倍開銷。
從戰略層面看,講者分析了企業 AI 的演進方向。傳統 SaaS 時代的競爭邏輯是製造「摩擦」——通過高轉換成本、集成深度、數據鎖定讓用戶難以離開。但技能正在創造完全不同的「流暢模式」生態。這裡的邏輯是反向的:每增加一項設計精良的技能,都會提升平台的使用體驗。隨著體驗累積,用戶因為愛上這個平台而不想離開。體驗的本質是「意圖到結果之間的摩擦最小化」,技能使得平台能將這種體驗差異作為核心商業邏輯,並且衍生出新的評估維度——「可教性」(Learnability):新用戶或代理框架首次接觸時,能否在秒級內掌握並應用技能。
講座強調了技能與 MCP 的互補性而非競爭。MCP 適合隔離關鍵流程、管理外部數據訪問(如醫療記錄)或處理需要專用資源的任務。技能則與代理緊密集成,支持自我修改——代理可根據使用經驗更新自己的技能。開源項目 Open Agent 生動展示了這種潛力:一個僅有約 10 個工具的編碼代理,透過技能實現了自我修復、自我編寫技能、自我擴展能力。這改變了企業解決方案的設計思路:不必為每個用例構建獨立代理,只需構建一個優秀的通用代理引擎,然後在其上層堆砌領域特定技能。
最後,講者強調質量控制至關重要。雖然 LLM 可以生成技能,但研究表明 AI 生成的技能實際上損害模型性能——它消耗更多 token、增加推理時間,反而沒有幫助。當前 26 個平台支持技能、數十萬種技能已發佈,但市場缺乏驗證機制——這讓人想起 10 年前的 NPM 野蠻生長期。技能需要像軟體一樣經歷版本控制、評估、測試的嚴格流程,唯有如此才能編寫出真正優秀的技能。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


