KeyFrame內部研究專用

1390万次下载的 Skill 为什么在你电脑上跑不通?

Why QQ·8月10日週一·12 min中文

三句話摘要

AI Agent 的交付危機:從「光會想不會做」看運行環境、Skill 流程與應用驗收三層工程的完整性。 Skill 不是能力本身,是能力的施工圖;沒有運行環境施工圖落不了地,沒有應用驗收落地也不等於交付。 Skill 的本質是施工圖,不是魔法。Skill 目錄裡有 skill.md、指令和素材,但手冊有腳本不代表腳本能跑,目錄有素材不代表客戶端有權限讀取。延遲披露機制讓模型開始只看名稱和用途,真正使用時才加載完整內容,這能優化上下文但也提醒我們:Skill 解決的是「怎麼把知識交給模型」,不是「怎麼保證模型擁有全部執行條件」。

重點整理

重點
  • 1

    Skill 的本質是施工圖,不是魔法。Skill 目錄裡有 skill.md、指令和素材,但手冊有腳本不代表腳本能跑,目錄有素材不代表客戶端有權限讀取。延遲披露機制讓模型開始只看名稱和用途,真正使用時才加載完整內容,這能優化上下文但也提醒我們:Skill 解決的是「怎麼把知識交給模型」,不是「怎麼保證模型擁有全部執行條件」。

  • 2

    運行環境決定執行邊界。Cloudflare Computer 預覽版設計了統一執行入口,背後支持三種後端(真 Linux 容器、Worker 裡的 JS、隔離 JS 模組)。文件持久化、隔離策略、聯網能力都有成本:在 EVCPU 6G 記憶體容器中,tnpfs 安裝 854 個 npm 包耗時 34.3 秒,Computer 的 fuse 則需 124.7 秒。持久化與隔離不是免費的。

  • 3

    應用層才是「做完」的定義。KimiPPT 項目把 PPT 生成拆成可執行流程:先規劃內容、生成 PPTD、驗證格式、導出圖片、檢查視覺問題、修正 PPTD,最後交付完整 PPTX。只生成大綱不算做完,導出打不開的檔也不算,沒人檢查更不算。這層定義了交付標準、失敗定位、二次編輯能力。

實用技巧與重點

乾貨
  • Matpok Skills 合集:截至 2026 年 8 月 6 日,51 個 Skill,約 1390 萬安裝量,倉庫約 20.6 萬個 Star,GetUpStar 排名第 23 位
  • Cloudflare Computer 文件系統:約 10GB 容量與宿主 Durable Object 共享
  • tnpfs 安裝 npm 依賴耗時:34.3 秒(854 個套件、36,675 個檔案)
  • extas 耗時:63.9 秒
  • Computer fuse 耗時:124.7 秒
  • KimiPPT 需求:Node.js 18+、Python、Chromium 瀏覽器、網路存取 kimi.com、statics.moonshot.cn
  • Skill 安全考量:AllowedTools 當前仍是實驗性規範

結論

結論

Skill 不是能力本身,是能力的施工圖;沒有運行環境施工圖落不了地,沒有應用驗收落地也不等於交付。

完整解析

詳細

Agent 光會想不會做,根本不在於模型聰不聰明,而在於工程層面缺了哪一塊。許多人裝完 Skill 就以為能自動執行,實際上這涉及三層獨立的工程問題。

第一層是運行環境。Cloudflare 最近開源的 Computer 項目回答了「Agent 需要什麼樣的電腦」這個核心問題。它不只是給 Agent 一個 Shell,而是提供了帶檔案狀態、執行後端和隔離策略的工作區。當前實現支持三種後端:真 Linux 容器(能跑二進制,有真實網路),Worker 裡的 JS(輕量但不是完整 Linux),以及隔離的 JavaScript 模組(最輕量)。但這裡有個關鍵:檔案由誰持久化、哪個後端可以聯網、失敗後怎麼回收、結果能否重放——這些都有工程成本。Cloudflare 公開的基準測試顯示,相同環境下安裝依賴,持久化和隔離策略會讓執行時間成倍增長。這不是模型問題,是運行時的實實在在成本。

第二層是 Skill 流程。Agent Skills 規範定義了 Skill 作為一個目錄,裡面有 skill.md(說明和操作步驟)、腳本、參考資料和素材。講者強調,Skill 更像一份可付用的作業手冊,不是簡單的提示詞。問題在於,手冊寫了脆本不代表脆本能跑,目錄放了素材不代表客戶端有權限讀取。Matpok 展示的 51 個 Skill 案例各有不同,比如 TDD Skill 不會自動保證測試能跑,調試 Skill 不會凭空製造日誌。它們解決的是「把高手腦子裡的操作順序和判斷標準寫成模型可以調用的程序性知識」。這對團隊規範、代碼審查標準的穩定傳遞很有價值,但延遲披露機制(刚開始只看名稱和用途)也提醒我們,Skill 本身是供應鏈輸入,有安全風險。

第三層是應用驗收。KimiPPT 項目最清晰地展示了這一點。它不是只寫一段提示詞讓模型生成幻燈片,而是把 PPT 這件事拆成了一個完整可執行流程:規劃內容、生成 PPTD 格式(用 YAML 描述元素和位置,比直接操作 OOXML 簡單),驗證格式,導出頁面圖片,檢查是否有遮擋、溢出、對比度或排版問題,然後繼續修改。交付不只是中間文件,而是可打開的完整 PPTX。運行環境回答「能不能跑」,Skill 回答「知不知道怎麼做」,應用層回答「怎樣才算做完」。只生成文字大綱不算,導出打不開的檔也不算,沒人檢查更不算。

關鍵反轉在此:同一個 Skill 複製到另一台機器,Agent 可以正常讀懂它,卻未必能跑出同樣結果。格式可移植不代表能力可移植,流程能複用不代表交付能複線。Skill 本身也要看來源、審查腳本、限制權限。越是能自動執行的 Skill 越危險,因為它可能把代碼、網路存取和檔案操作都綁在一起。真正的競爭正在從「能不能生成」轉向「能不能可靠交付」。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。