KeyFrame內部研究專用

Everything Is a Rollout — Alex Shaw + Ryan Marten, Terminal-Bench, Harbor, Laude Institute

AI Engineer·7月24日週五·21 min英文

三句話摘要

Harbor:用Rollout統一代理評估的開源框架。 代理開發已從軟體工程轉向機器學習範式,Harbor通過統一的Rollout框架讓評估變成了代理開發的科學基礎。 代理開發典範轉移:2018年代碼執行前已知結果;2026年代理行為則不確定,需像對待機器學習模型一樣,透過實證評估來管理代理性能。代理本質上是黑盒、需要通過rollout來理解和改進。

重點整理

重點
  • 1

    代理開發典範轉移:2018年代碼執行前已知結果;2026年代理行為則不確定,需像對待機器學習模型一樣,透過實證評估來管理代理性能。代理本質上是黑盒、需要通過rollout來理解和改進。

  • 2

    機器學習與代理開發的系統類比:訓練集→環境/Avals、權重→技能/提示/工具、損失函數→環境獎勵、梯度下降→PR提交。這套完整類比說明代理開發工具應如何設計。

  • 3

    評估優先策略:Satya Nadella的建議是先建立eval再優化,一旦掌握評估方法就掌握主動權——能選擇任何模型、不必依賴品牌或公開基準。這轉移了決策權從廠商到開發者。

  • 4

    四類評估用途涵蓋全部應用場景:評估代理構建產品、代理使用你的產品、代理作為產品功能、自動化內部流程。幾乎所有軟體公司都該考慮其中至少一項。

實用技巧與重點

乾貨
  • 框架與工具
  • Harbor:開源框架,支援平行rollout、任何代理、任何模型、任何沙箱
  • 已有3-400個評估集
  • 文件目錄為標準環境規範格式
  • Rollout基本元件
  • 指令(告訴代理做什麼)
  • 沙箱(虛擬環境執行)
  • 代理(執行指令)
  • 軌跡(執行過程記錄)
  • 驗證器(檢查任務完成狀況)
  • 獎勵(反饋訊號)
  • 命令示例
  • `harbor run terminal_bench_2.1 with codec and gpt-4.5 --parallel 64 --launch`
  • `harbor exec input [files] --prompt [map_prompt] --reduce [reduce_prompt]`
  • 四類評估用途
  • 代理如何構建你的產品(Ramp的SWE Bench基於內部代碼庫)
  • 代理如何使用你的產品
  • 代理作為產品功能
  • 代理自動化內部流程
  • 採用者名單
  • Frontier Suite、ToolBench(Handshake)、Cognition、RuneScape基準、Scale的Atlas Suite、PoolSide、AutoAgent、Frontier Code、Snorkel的Senior Suite Bench
  • 模型搭配
  • Cursor CLI:用於Map步驟(便宜快速)
  • Claude Fable 5:用於Reduce步驟(需要智能總結)

結論

結論

代理開發已從軟體工程轉向機器學習範式,Harbor通過統一的Rollout框架讓評估變成了代理開發的科學基礎。

完整解析

詳細

代理開發正處於根本性的範式轉移。2018年軟體工程建立在確定性基礎上——你寫出的代碼執行結果完全可預測。用正則表達式提取電話號碼時,開發者對程式運行百萬次的結果有100%把握。但2026年代理時代改變了這一切。用GPT-4.5替代正則表達式雖然能處理格式各異的電話號碼,更加強大,但運行同一程式百萬次時,結果並非完全一致。隨著任務複雜度提升,不確定性呈指數級增長。

這個認知轉變帶來了關鍵問題:既然代理行為是黑盒,該如何評估?Francois Chalet的答案很清晰——應該用機器學習的方法評估代理。這導出了一套完整的類比框架:機器學習的訓練集對應代理的環境、測試集對應Avals、模型權重對應技能和提示、損失函數對應環境獎勵、梯度下降對應PR提交。這套類比系統性地指導了應該如何設計代理開發工具。

Harbor就是按照這套邏輯構建的。其核心是「Rollout」概念:給定任務指令,在虛擬沙箱中運行代理,代理執行過程產生軌跡,驗證器檢查是否完成並產生獎勵反饋。看似簡單的流程卻異常通用——支援多步操作、並行驗證、文物收集、模擬用戶交互等各種變體。Harbor既是開源框架支持平行運行,也是通用語言讓不同團隊以互操作方式定義環境。

Satya Nadella的建議很實用:「評估優先,歡迎所有模型」。一旦建立了評估系統,開發者就掌握主動權——可以試驗任何模型、不跟著廠商名牌走、不依賴公開基準。核心邏輯是先建eval、後優化。無論是評估代理如何構建自己的產品(Ramp用內部代碼構建SWE Bench)、評估代理如何使用你的軟體、評估代理作為產品功能、還是自動化內部流程,這些應用正在發生。

Beyond傳統評估,社群還創意地用Harbor做「代理MapReduce」——平行運行數千個代理在分佈式計算上,例如檢測獎勵駭客、批處理報銷單據、語義搜索筆記。開發者利用Rollout軌跡進行有監督微調或強化學習,甚至用演化算法自動爬坡。社區內涌現創新——Cognition遷移整套Evals到Harbor、PoolSide用它訓練模型、Scale發佈Atlas Suite、Snorkel發佈Senior Suite Bench測量模糊場景下的代理能力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。