Everything Is a Rollout — Alex Shaw + Ryan Marten, Terminal-Bench, Harbor, Laude Institute
三句話摘要
Harbor:用Rollout統一代理評估的開源框架。 代理開發已從軟體工程轉向機器學習範式,Harbor通過統一的Rollout框架讓評估變成了代理開發的科學基礎。 代理開發典範轉移:2018年代碼執行前已知結果;2026年代理行為則不確定,需像對待機器學習模型一樣,透過實證評估來管理代理性能。代理本質上是黑盒、需要通過rollout來理解和改進。
重點整理
重點- 1
代理開發典範轉移:2018年代碼執行前已知結果;2026年代理行為則不確定,需像對待機器學習模型一樣,透過實證評估來管理代理性能。代理本質上是黑盒、需要通過rollout來理解和改進。
- 2
機器學習與代理開發的系統類比:訓練集→環境/Avals、權重→技能/提示/工具、損失函數→環境獎勵、梯度下降→PR提交。這套完整類比說明代理開發工具應如何設計。
- 3
評估優先策略:Satya Nadella的建議是先建立eval再優化,一旦掌握評估方法就掌握主動權——能選擇任何模型、不必依賴品牌或公開基準。這轉移了決策權從廠商到開發者。
- 4
四類評估用途涵蓋全部應用場景:評估代理構建產品、代理使用你的產品、代理作為產品功能、自動化內部流程。幾乎所有軟體公司都該考慮其中至少一項。
實用技巧與重點
乾貨- 框架與工具
- Harbor:開源框架,支援平行rollout、任何代理、任何模型、任何沙箱
- 已有3-400個評估集
- 文件目錄為標準環境規範格式
- Rollout基本元件
- 指令(告訴代理做什麼)
- 沙箱(虛擬環境執行)
- 代理(執行指令)
- 軌跡(執行過程記錄)
- 驗證器(檢查任務完成狀況)
- 獎勵(反饋訊號)
- 命令示例
- `harbor run terminal_bench_2.1 with codec and gpt-4.5 --parallel 64 --launch`
- `harbor exec input [files] --prompt [map_prompt] --reduce [reduce_prompt]`
- 四類評估用途
- 代理如何構建你的產品(Ramp的SWE Bench基於內部代碼庫)
- 代理如何使用你的產品
- 代理作為產品功能
- 代理自動化內部流程
- 採用者名單
- Frontier Suite、ToolBench(Handshake)、Cognition、RuneScape基準、Scale的Atlas Suite、PoolSide、AutoAgent、Frontier Code、Snorkel的Senior Suite Bench
- 模型搭配
- Cursor CLI:用於Map步驟(便宜快速)
- Claude Fable 5:用於Reduce步驟(需要智能總結)
結論
結論“代理開發已從軟體工程轉向機器學習範式,Harbor通過統一的Rollout框架讓評估變成了代理開發的科學基礎。”
完整解析
詳細代理開發正處於根本性的範式轉移。2018年軟體工程建立在確定性基礎上——你寫出的代碼執行結果完全可預測。用正則表達式提取電話號碼時,開發者對程式運行百萬次的結果有100%把握。但2026年代理時代改變了這一切。用GPT-4.5替代正則表達式雖然能處理格式各異的電話號碼,更加強大,但運行同一程式百萬次時,結果並非完全一致。隨著任務複雜度提升,不確定性呈指數級增長。
這個認知轉變帶來了關鍵問題:既然代理行為是黑盒,該如何評估?Francois Chalet的答案很清晰——應該用機器學習的方法評估代理。這導出了一套完整的類比框架:機器學習的訓練集對應代理的環境、測試集對應Avals、模型權重對應技能和提示、損失函數對應環境獎勵、梯度下降對應PR提交。這套類比系統性地指導了應該如何設計代理開發工具。
Harbor就是按照這套邏輯構建的。其核心是「Rollout」概念:給定任務指令,在虛擬沙箱中運行代理,代理執行過程產生軌跡,驗證器檢查是否完成並產生獎勵反饋。看似簡單的流程卻異常通用——支援多步操作、並行驗證、文物收集、模擬用戶交互等各種變體。Harbor既是開源框架支持平行運行,也是通用語言讓不同團隊以互操作方式定義環境。
Satya Nadella的建議很實用:「評估優先,歡迎所有模型」。一旦建立了評估系統,開發者就掌握主動權——可以試驗任何模型、不跟著廠商名牌走、不依賴公開基準。核心邏輯是先建eval、後優化。無論是評估代理如何構建自己的產品(Ramp用內部代碼構建SWE Bench)、評估代理如何使用你的軟體、評估代理作為產品功能、還是自動化內部流程,這些應用正在發生。
Beyond傳統評估,社群還創意地用Harbor做「代理MapReduce」——平行運行數千個代理在分佈式計算上,例如檢測獎勵駭客、批處理報銷單據、語義搜索筆記。開發者利用Rollout軌跡進行有監督微調或強化學習,甚至用演化算法自動爬坡。社區內涌現創新——Cognition遷移整套Evals到Harbor、PoolSide用它訓練模型、Scale發佈Atlas Suite、Snorkel發佈Senior Suite Bench測量模糊場景下的代理能力。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


