KeyFrame內部研究專用

Brian Douglas - The beginners guide to training AI on your own code - AI Native DevCon June 2026

Tessl AI·7月24日週五·31 min英文

三句話摘要

如何從付費 AI 會話數據中持續提取價值:通過記錄、分析、技能生成和模型微調,打造自我學習的 AI 代理系統。 付費 AI 會話中蘊含的學習信號不應被浪費;系統性地記錄、分析、生成 skills,甚至微調小模型,才能從每次互動中榨取最大價值並實現真正的知識轉移。 會話數據是被忽視的資產。用戶每天付費使用 Claude/Cursor 產生的所有互動數據在 30 天後自動刪除。講者用 tapes.dev 持續記錄 77,000 個會話(約 4GB 數據),相當於每週 1GB,年度可達 50-100GB,這些都可轉化為學習信號。

重點整理

重點
  • 1

    會話數據是被忽視的資產。用戶每天付費使用 Claude/Cursor 產生的所有互動數據在 30 天後自動刪除。講者用 tapes.dev 持續記錄 77,000 個會話(約 4GB 數據),相當於每週 1GB,年度可達 50-100GB,這些都可轉化為學習信號。

  • 2

    通過觀察與反饋實現代理自我改進。講者用 10 個並行代理各執行 Pokemon 遊戲 1000 轉,不是直接告訴代理「跟 NPC 說話」,而是記錄失敗點和結構化觀測狀態(移動方向、冷卻時間、位置),代理逐漸自主發現規則——過門需要 7 秒冷卻、選擇寶可夢要按 B 鍵。這套循環適用於任何複雜系統的代碼庫學習。

  • 3

    技能生成管道。將向量化的會話數據庫用自然語言搜索,抽取高價值的互動模式,自動或手工生成可復用 skills。用小模型(Haiku、Qwen 4B)也能完成特定領域任務,成本遠低於 Opus,且可轉移到其他 AI 工具(Codex、Cursor)。

  • 4

    模型微調的實踐與邊界。SFT(Specialized Fine-Tuning)在 4B 參數模型上效果不錯,適合本地運行;DPO(Direct Preference Optimization)成本高昂(需 32GB+ VRAM、H100 GPU),4B 模型上收效甚微,只有 7B+ 才有意義,但費用可達每週 $1000。

實用技巧與重點

乾貨
  • 工具與平台
  • tapes.dev(開源,CLI + 可視化 tapes deck)
  • Stereos(代理運行時,提供沙箱 + 會話自動記錄)
  • Pygame Boy(Python 遊戲模擬器,headless 運行)
  • LansDB(向量檢索庫)
  • Qora/PyTorch/Unsloth(微調工具)
  • 數據規模
  • 每週 ~1GB 數據,年度 50-100GB
  • 講者積累 77,000 會話(4GB)
  • 每次會話 1,000+ 轉(turns)
  • 具體流程
  • 10 並行代理 × 1,000 轉 → Postgres 數據庫 → Markdown 觀測記錄 + JSON 觀測狀態
  • 自然語言搜索會話 → 識別 anomaly(失敗點或高成功模式)→ 生成 skill
  • SFT 微調基礎模型(Qwen 4B/7B、Claude Opus)
  • Pokemon 案例解決方案
  • 代理問題 1:不知道跟 NPC 說話 → 解決:構建「NPC 交互」觀測狀態
  • 代理問題 2:過門無限卡頓 → 解決:記錄發現 7 秒冷卻規則
  • 代理問題 3:選擇寶可夢失敗 → 解決:發現需按 B 確認而非 A
  • 成果指標
  • 清理 100 用戶項目的 6 個月遺留 lint 錯誤:1 小時內完成
  • Cursor 與 SpaceX 協議:$10 billion(你的數據被用於訓練)
  • Anthropic 剛提交 IPO S-1 申報

結論

結論

付費 AI 會話中蘊含的學習信號不應被浪費;系統性地記錄、分析、生成 skills,甚至微調小模型,才能從每次互動中榨取最大價值並實現真正的知識轉移。

完整解析

詳細

Brian Douglas 是 GitHub 資深員工,如今在 Paper Compute 公司研發 AI 代理基礎設施。他用一個看似「玩遊戲」的案例揭示了 AI 訓練的本質:系統性地從失敗中提取模式。

講者設計了一套實驗:用 Pygame Boy 模擬器在本地運行 Pokemon 紅版遊戲,通過 Claude Code 驅動 10 個並行代理,每個代理嘗試 1000 步內完成從開始到獲得第一只寶可夢的任務。看似簡單的目標卻暴露了代理的無知:它不知道要跟 NPC 對話、不知道進出門有 7 秒冷卻、不知道確認選擇要按 B 鍵。傳統做法是直接給代理提示,但講者採取了另一條路——完整記錄每次失敗。他用 tapes.dev(一個開源工具)將所有 10 個代理的會話存入 Postgres 數據庫,每 10 步截圖一次,每個 tool call 都被記錄。失敗時,他不手工修正,而是將觀察結果寫成 Markdown 筆記(如「代理從未與任何 NPC 互動」)和結構化 JSON 狀態(記錄移動方向、當前位置、冷卻計時器),讓代理讀取這些反饋自己改進策略。

這個看似「玩遊戲」的練習實際上是在教一個至關重要的課題:現今用戶每天在 Claude、Cursor 等工具上付費生成的每一個會話,包含豐富的學習信號——失敗點、工具調用模式、token 消耗等——但這些數據在 30 天內就被默認刪除。講者觀察到,用戶付費獲得的 token 額度不能轉移、不能再用,年度浪費高達 50-100GB 的數據。他開發的 Sweeper Agent 工具展示了另一種可能:用 10 個並行代理對整個代碼庫進行自動清理(linting)、文檔生成或規範化,同時持續記錄每個代理的會話軌跡。這些軌跡被向量化存儲,支持自然語言查詢(如「如何解決 Pokemon 中的過門冷卻問題」),讓用戶或模型自動從真實會話中歸納出可復用的 skills。

最後一步是知識的「固化」——通過模型微調將積累的 skills 嵌入到小型語言模型。講者用 77,000 個真實會話數據對 Qwen 4B 模型進行 SFT(Specialized Fine-Tuning),結果不錯,特別適合本地運行或處理特定領域問題。他也實驗了 DPO(Direct Preference Optimization),原理是讓模型永遠選擇更好的選項,但代價昂貴——4B 模型需要 32GB VRAM + H100 GPU,結果卻不理想;只有 7B 參數以上才實用,但成本可達每週 $1000。講者坦言 DPO 目前只適合大型研究機構,他自己正在與真正的研究者合作探索更優方案。

整套流程的核心邏輯是:別讓會話數據白白浪費 → 系統記錄 → 分析提取價值 → 生成 skills 供多個 AI 工具復用 → 最後用微調模型實現本地化或成本優化。這打破了「每次都用最新最貴的模型」的固化思維,引入了「知識轉移」的新維度。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。