KeyFrame內部研究專用

OpenClaw Creator's new secret project...

AI Jason·6月24日週三·13 min中文

三句話摘要

Crab Box:讓 AI Agent 在雲端隔離沙箱環境中並行測試與驗證,解決多 Agent 平行運行時的環境衝突問題。 Crab Box 透過雲端沙箱隔離與增量檔案同步,解決了大規模並行 Agent 開發最後一哩路的瓶頸,使得數十個 Agent 能在同一時刻各自獨立驗證工作,並自動附帶測試證據,是構建高效能 Agent 協作開發系統的關鍵基礎設施。 1. 大規模平行 Agent 的測試瓶頸 — 當同時運行 10+ 個 Agent 時,傳統的單機開發環境面臨資源競爭、數據庫衝突等問題,導致測試結果不可靠。原因在於共享的 Docker daemon、數據庫實例、硬編碼的埠號,使得多個工作樹無法真正隔離。

重點整理

重點
  • 1

    1. 大規模平行 Agent 的測試瓶頸 — 當同時運行 10+ 個 Agent 時,傳統的單機開發環境面臨資源競爭、數據庫衝突等問題,導致測試結果不可靠。原因在於共享的 Docker daemon、數據庫實例、硬編碼的埠號,使得多個工作樹無法真正隔離。

  • 2

    2. Crab Box 的核心設計 — 每個 Agent 在雲端獲得自己的完整沙箱環境(包含獨立 DB 與應用伺服器),透過檔案增量同步機制避免重複部署,同時支持實時命令執行與動態測試。這使得 Agent 無需等待提交流程,改進本地檔案後立即重新測試。

  • 3

    3. 配置即代碼的簡化方式 — 透過 `crabbox.yaml`(定義沙箱提供商、環境變數、同步規則)與 `setup.sh`(自動化部署指令)兩個檔案,Agent 可一鍵啟動完整的開發環境,降低了複雜的基礎設施配置門檻。

  • 4

    4. 證據自動回傳的工作流優化 — Crab Box 內建 `artifact` 指令家族,可自動蒐集測試結果(截圖、錄影),並直接上傳至 S3 或 GitHub Release,使 Agent 撰寫的 PR 包含完整的測試證據,加速審核與合併流程。

實用技巧與重點

乾貨
  • 工具與平台:Crab Box、Daytona(沙箱提供商)、Docker、Superbase、Playwright(端到端測試)、GitHub Release Assets
  • 核心命令
  • `crabbox one-map`:啟動雲端沙箱
  • `crabbox run [provider] [id]`:在沙箱中執行命令並自動同步檔案
  • `crabbox run --nosync`:不同步檔案直接執行(適用於讀檔或測試)
  • `crabbox stop`:關閉並清理沙箱
  • `artifact global`、`artifact screenshot`、`artifact video`、`artifact publish`:蒐集與發佈測試證據
  • SSH 隧道連接本地測試:`ssh -i key -L 3000:sandbox:3000 -L backend:sandbox:backend user@sandbox` 將雲端伺服器暴露至本地瀏覽器
  • Daytona 設定流程
  • `datona login`
  • `datona organization list` / `datona organization use [org]`
  • `datona snapshot create [name] --dockerfile [path] --cpu [核心] --memory [GB] --disk [GB] --region [區域]`
  • 環境變數配置:通過 `crabbox.yaml` 的環境變數段落定義,自動透過 SSH 安全傳遞至沙箱
  • 同步排除規則:在 `crabbox.yaml` 中設 `exclude` 標籤排除 node_modules、.turbo 等不需同步的重檔案夾
  • 並行 Agent 數量:演示中展示至少 15 個並行工作階段無衝突運行
  • 實際測試策略:定義 Bash wrapper 指令(如 `cbx.sh`)預設化 provider、--nosync 旗標等,並使用背景執行搭配 10 秒輪詢監控直到環境就緒
  • 可選文件:提供開源的 `crabbox-setup-sku` 與 `setup-codebase-harness-sku` 供用戶快速複製

結論

結論

Crab Box 透過雲端沙箱隔離與增量檔案同步,解決了大規模並行 Agent 開發最後一哩路的瓶頸,使得數十個 Agent 能在同一時刻各自獨立驗證工作,並自動附帶測試證據,是構建高效能 Agent 協作開發系統的關鍵基礎設施。

完整解析

詳細

當 AI Agent 的使用規模從個位數擴展至十數個並行運行時,開發團隊面臨一個關鍵瓶頸:如何在保證環境隔離的前提下,讓每個 Agent 都能獨立驗證自己的工作成果。傳統做法是在本地機器上為每個工作樹啟動一套開發環境,但這方案很快就碰到無法調和的衝突。一臺電腦只有一個 Docker daemon、一個資料庫實例,埠號通常是硬編碼的,結果是多個工作樹搶奪同一份資源,任何一個 Agent 對資料庫 schema 的改動都會連鎖破壞其他所有工作階段。即使透過小心的設計避免了這些衝突,運行現代化的完整應用伺服器仍然耗資源巨大,難以在本地機器上無限擴展。

Crab Box 的解決方案是將這套隔離環境搬到雲端。每個 Agent 啟動時,都會在遠端沙箱提供商(如 Daytona)那裡為自己租借一臺獨立的虛擬機,包含完全隔離的資料庫、應用伺服器埠號、以及檔案系統。但 Crab Box 並未止步於簡單的遠端虛擬機調度:它實現了增量檔案同步機制,使得 Agent 在本地修改程式碼後,無需提交也無需重新部署整個環境,只需執行 `crabbox run` 指令就會自動將增量變更同步到沙箱並執行命令。這是傳統 CI/CD 流程做不到的,因為 CI/CD 往往假設代碼已經提交並推送。通過這個設計,Agent 可以形成快速迭代迴圈:修改 → 同步 → 測試 → 查看結果,而完全不會干擾其他 Agent 的運行環境。

配置層面,Crab Box 採用了「配置即代碼」的哲學。只要撰寫兩個檔案就能構建整套自動化:`crabbox.yaml` 定義沙箱基礎設施(提供商、CPU 記憶體、環境變數、哪些資料夾不需同步),`setup.sh` 是一段初始化指令碼,負責在沙箱啟動時安裝依賴、啟動應用伺服器等重複性工作。演講者展示的實例使用了 Daytona 作為沙箱提供商,先建立 Docker snapshot(預先打包的環境映像,啟動速度快),再連接 API key 便可自動化啟停機器。為了進一步簡化 Agent 的命令界面,可以額外封裝一個 Bash wrapper(如 `cbx.sh`),將複雜的參數和旗標隱藏起來,Agent 只需執行一行簡單的指令。

工作流的完成不只靠程式碼通過測試,更重要的是 Agent 能證明測試確實有跑過。Crab Box 內建的 `artifact` 指令家族自動蒐集測試證據,包括端到端測試的截圖、整個操作的錄影檔,甚至可以直接上傳至 S3 或 GitHub Release Assets。Agent 撰寫的 PR 會自動附帶這些視覺證據,人工審核時不再需要猜測「這個 Agent 有沒有真的測過」,而是直接看到完整的執行記錄。這大幅降低了審核風險,加速了大規模並行 Agent 系統從「寫碼」到「上線」的整個流程。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。