Brian Douglas - The beginners guide to training AI on your own code - AI Native DevCon June 2026
三句話摘要
如何從付費 AI 會話數據中持續提取價值:通過記錄、分析、技能生成和模型微調,打造自我學習的 AI 代理系統。 付費 AI 會話中蘊含的學習信號不應被浪費;系統性地記錄、分析、生成 skills,甚至微調小模型,才能從每次互動中榨取最大價值並實現真正的知識轉移。 會話數據是被忽視的資產。用戶每天付費使用 Claude/Cursor 產生的所有互動數據在 30 天後自動刪除。講者用 tapes.dev 持續記錄 77,000 個會話(約 4GB 數據),相當於每週 1GB,年度可達 50-100GB,這些都可轉化為學習信號。
重點整理
重點- 1
會話數據是被忽視的資產。用戶每天付費使用 Claude/Cursor 產生的所有互動數據在 30 天後自動刪除。講者用 tapes.dev 持續記錄 77,000 個會話(約 4GB 數據),相當於每週 1GB,年度可達 50-100GB,這些都可轉化為學習信號。
- 2
通過觀察與反饋實現代理自我改進。講者用 10 個並行代理各執行 Pokemon 遊戲 1000 轉,不是直接告訴代理「跟 NPC 說話」,而是記錄失敗點和結構化觀測狀態(移動方向、冷卻時間、位置),代理逐漸自主發現規則——過門需要 7 秒冷卻、選擇寶可夢要按 B 鍵。這套循環適用於任何複雜系統的代碼庫學習。
- 3
技能生成管道。將向量化的會話數據庫用自然語言搜索,抽取高價值的互動模式,自動或手工生成可復用 skills。用小模型(Haiku、Qwen 4B)也能完成特定領域任務,成本遠低於 Opus,且可轉移到其他 AI 工具(Codex、Cursor)。
- 4
模型微調的實踐與邊界。SFT(Specialized Fine-Tuning)在 4B 參數模型上效果不錯,適合本地運行;DPO(Direct Preference Optimization)成本高昂(需 32GB+ VRAM、H100 GPU),4B 模型上收效甚微,只有 7B+ 才有意義,但費用可達每週 $1000。
實用技巧與重點
乾貨- 工具與平台
- tapes.dev(開源,CLI + 可視化 tapes deck)
- Stereos(代理運行時,提供沙箱 + 會話自動記錄)
- Pygame Boy(Python 遊戲模擬器,headless 運行)
- LansDB(向量檢索庫)
- Qora/PyTorch/Unsloth(微調工具)
- 數據規模
- 每週 ~1GB 數據,年度 50-100GB
- 講者積累 77,000 會話(4GB)
- 每次會話 1,000+ 轉(turns)
- 具體流程
- 10 並行代理 × 1,000 轉 → Postgres 數據庫 → Markdown 觀測記錄 + JSON 觀測狀態
- 自然語言搜索會話 → 識別 anomaly(失敗點或高成功模式)→ 生成 skill
- SFT 微調基礎模型(Qwen 4B/7B、Claude Opus)
- Pokemon 案例解決方案
- 代理問題 1:不知道跟 NPC 說話 → 解決:構建「NPC 交互」觀測狀態
- 代理問題 2:過門無限卡頓 → 解決:記錄發現 7 秒冷卻規則
- 代理問題 3:選擇寶可夢失敗 → 解決:發現需按 B 確認而非 A
- 成果指標
- 清理 100 用戶項目的 6 個月遺留 lint 錯誤:1 小時內完成
- Cursor 與 SpaceX 協議:$10 billion(你的數據被用於訓練)
- Anthropic 剛提交 IPO S-1 申報
結論
結論“付費 AI 會話中蘊含的學習信號不應被浪費;系統性地記錄、分析、生成 skills,甚至微調小模型,才能從每次互動中榨取最大價值並實現真正的知識轉移。”
完整解析
詳細Brian Douglas 是 GitHub 資深員工,如今在 Paper Compute 公司研發 AI 代理基礎設施。他用一個看似「玩遊戲」的案例揭示了 AI 訓練的本質:系統性地從失敗中提取模式。
講者設計了一套實驗:用 Pygame Boy 模擬器在本地運行 Pokemon 紅版遊戲,通過 Claude Code 驅動 10 個並行代理,每個代理嘗試 1000 步內完成從開始到獲得第一只寶可夢的任務。看似簡單的目標卻暴露了代理的無知:它不知道要跟 NPC 對話、不知道進出門有 7 秒冷卻、不知道確認選擇要按 B 鍵。傳統做法是直接給代理提示,但講者採取了另一條路——完整記錄每次失敗。他用 tapes.dev(一個開源工具)將所有 10 個代理的會話存入 Postgres 數據庫,每 10 步截圖一次,每個 tool call 都被記錄。失敗時,他不手工修正,而是將觀察結果寫成 Markdown 筆記(如「代理從未與任何 NPC 互動」)和結構化 JSON 狀態(記錄移動方向、當前位置、冷卻計時器),讓代理讀取這些反饋自己改進策略。
這個看似「玩遊戲」的練習實際上是在教一個至關重要的課題:現今用戶每天在 Claude、Cursor 等工具上付費生成的每一個會話,包含豐富的學習信號——失敗點、工具調用模式、token 消耗等——但這些數據在 30 天內就被默認刪除。講者觀察到,用戶付費獲得的 token 額度不能轉移、不能再用,年度浪費高達 50-100GB 的數據。他開發的 Sweeper Agent 工具展示了另一種可能:用 10 個並行代理對整個代碼庫進行自動清理(linting)、文檔生成或規範化,同時持續記錄每個代理的會話軌跡。這些軌跡被向量化存儲,支持自然語言查詢(如「如何解決 Pokemon 中的過門冷卻問題」),讓用戶或模型自動從真實會話中歸納出可復用的 skills。
最後一步是知識的「固化」——通過模型微調將積累的 skills 嵌入到小型語言模型。講者用 77,000 個真實會話數據對 Qwen 4B 模型進行 SFT(Specialized Fine-Tuning),結果不錯,特別適合本地運行或處理特定領域問題。他也實驗了 DPO(Direct Preference Optimization),原理是讓模型永遠選擇更好的選項,但代價昂貴——4B 模型需要 32GB VRAM + H100 GPU,結果卻不理想;只有 7B 參數以上才實用,但成本可達每週 $1000。講者坦言 DPO 目前只適合大型研究機構,他自己正在與真正的研究者合作探索更優方案。
整套流程的核心邏輯是:別讓會話數據白白浪費 → 系統記錄 → 分析提取價值 → 生成 skills 供多個 AI 工具復用 → 最後用微調模型實現本地化或成本優化。這打破了「每次都用最新最貴的模型」的固化思維,引入了「知識轉移」的新維度。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


