KeyFrame內部研究專用

I Run a Fleet of AI Agents Across Three Machines. Here's What Broke. - Kyle Jaejun Lee, KRAFTON

AI Engineer·7月8日週三·9 min英文

三句話摘要

大規模 AI 編碼代理舰隊的架構設計與跨機器編排的實戰經驗 大規模代理管理的核心不在單台機器的優化,而在通過層級組織、狀態持久化和統一控制點實現人類注意力的解放,未來應該建立在 Kubernetes 等已驗證的基礎設施上。 層級組織而非平面堆疊:借鑒企業管理模式,建立具有不同作用域和審批邊界的代理層級,使個人只需關注頂層結果而非每個代理的細節。

重點整理

重點
  • 1

    層級組織而非平面堆疊:借鑒企業管理模式,建立具有不同作用域和審批邊界的代理層級,使個人只需關注頂層結果而非每個代理的細節。

  • 2

    狀態持久化脫離模型上下文:代理狀態存儲在文件系統而非模型窗口,即便模型上下文滿溢或機器崩潰,工作進度也能通過讀取文件恢復,徹底解決窗口溢出問題。

  • 3

    單一審查網關作為控制點:所有層級的計劃提交到同一個審查入口等待批准,避免人工逐個檢查多個窗口,提高決策效率與一致性。

  • 4

    跨機器時的分離策略:機器特定的狀態各自保存,共享內容通過 pull request 同步,使用 Discord bot 作為統一的遠程控制入口,讓 MacBook 睡眠時系統仍可運作。

實用技巧與重點

乾貨
  • 架構層級:CEO、VP、Manager、Worker(真實的代理實體類型,非隱喻)
  • 狀態存儲位置
  • shared/:多代理共享的全局上下文
  • machines/:機器特定的狀態
  • 各代理工作區:mission、current status、handoff folder
  • 故障修復方案
  • 強制代理委派工作(CLI harness with skills)
  • 限制單窗口內的 pane 數量(Tmux 顯示問題)
  • 分離機器特定狀態目錄(內存碰撞)
  • 隔離憑證環境(跨工作區污染)
  • 啟動命令恢復全舰隊(overlord boot)
  • 機器分工
  • MacBook:個人項目(可睡眠)
  • Linux A:長期運行的編碼任務
  • Linux B:短期個人項目
  • 主網關:Linux box(always-on)
  • 跨機器同步:使用 git commit + push + SSH tmux send-keys 拉取
  • 遠程控制:每台機器一個 Discord bot,手機作為舰隊遠程控制器

結論

結論

大規模代理管理的核心不在單台機器的優化,而在通過層級組織、狀態持久化和統一控制點實現人類注意力的解放,未來應該建立在 Kubernetes 等已驗證的基礎設施上。

完整解析

詳細

Kyle 的故事始於一個看似簡單的問題:他用 AI 代理自動化日常工作,但很快發現自己成了系統的瓶頸。當同時管理 6 個代理時,他不再是在運行代理,而是在做三重角色——調度決策、上下文記憶、工作審查。這種認知負荷是不可持續的,關鍵的洞察來自企業管理學:高管不會將所有細節都存在腦裡,而是通過分離上下文、每個人只看自己的職責來解決這個問題。

基於這個想法,Kyle 建立了一個層級化的代理組織。CEO 代理接收任務,委派給 VP,VP 委派給 Manager,Manager 最終委派給具體執行的 Worker。每一層只需持有自己需要的上下文,結果向上流動。這不是一個比喻——這些是系統中真實的實體類型。為了避免代理狀態被困在單個模型的上下文窗口中,Kyle 將所有狀態移出模型,存儲在文件系統裡。每個代理有自己的工作區,當上下文滿時,他不再使用傳統的摘要壓縮(那會丟失信息),而是完全清空上下文,代理通過讀取它自己寫入的文件恢復進度。

隨著系統逐漸複雜,Kyle 遇到了更多問題:代理有時直接做工作而不是委派,Tmux 窗口擁擠到無法讀取,記憶體溢出。更關鍵的是,從單台 MacBook 擴展到多台機器時,新問題接踵而至——跨機器的上下文一致性、憑證污染、MacBook 意外睡眠導致任務丟失。逐一解決這些後,他意識到需要一個統一的控制入口。最後的創意是用 Discord bot 成為每台機器的控制代理,整個舰隊可以從手機遠程操作。

展望未來,Kyle 認識到他在重新發明的問題——任務編排、跨機器調度、資源管理——正是 Kubernetes 已經完美解決的。他計劃將 Kubernetes 的計算、憑證、工具管理作為基礎層,在其上構建自己的編排管理器和審查流程,這樣就不用重複造輪子。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。