Claude for Long-Horizon Tasks — Lance Martin, Anthropic
三句話摘要
Anthropic 的非同步代理設計理念:透過解耦架構、驗證迴圈、自學習記憶與組織級 harness,構建能獨立執行數小時到十多小時的智慧體。 長時間自主工作的模型需要系統性的設計——腦手分離保證可靠性、獨立驗證修正幻覺、自由的記憶管理加離線糾正、組織級 harness 放大效能——這些原則的組合比單純的模型能力提升同樣重要。 腦手分離保證長時間執行安全 — Managed Agents 將 harness 與 execution environments 分離,用 append-only event log 管理會話狀態。若某個容器或 harness 程序失敗,會話資料儲存在永久日誌中不會丟失,credentials 也存放在獨立的 vault 而非容器內,大幅降低了長時間執行的風險。
重點整理
重點- 1
腦手分離保證長時間執行安全 — Managed Agents 將 harness 與 execution environments 分離,用 append-only event log 管理會話狀態。若某個容器或 harness 程序失敗,會話資料儲存在永久日誌中不會丟失,credentials 也存放在獨立的 vault 而非容器內,大幅降低了長時間執行的風險。
- 2
獨立驗證迴圈勝過自我評分 — 讓同一個 context 既產出工作又評分會導致幻覺與混淆。用獨立的驗證 context 和驗證者進行 build-verify 迴圈,驗證者可以針對評鑑任務專門調優,直到模型達成預定結果才停止迴圈。
- 3
模型原生管理自己的記憶比預設schema更有效 — 高能力模型學會寫更高階的、能泛化到未來任務的記憶摘要,而非僅記錄戰術細節。關鍵是給模型自由的記憶substrate(檔案系統或資料庫),讓模型自己決定存什麼、怎麼組織,而非預先定義記憶schema。
- 4
Dreaming 流程糾正in-band記憶的錯誤 — 模型寫記憶時會犯錯且這些錯誤會被鎖定。需要離線的 dreaming 過程(檢查歷史會話與記憶store,找出並修正矛盾),這樣非同步代理在多小時執行中遇到的錯誤記憶才能被捕捉和修復。
實用技巧與重點
乾貨- 任務視野演進:Opus 3 時代 10-20 分鐘;過去一年 1 小時;最新前沿模型 12+ 小時(根據 Meter 基準測試)
- API 產品線演進:Message API(2 年前,簡單 prompt-response)→ Agents SDK(去年,程式設計呼叫 Claude Code)→ Managed Agents(4 月開始,完整 harness + 託管部署基礎設施)
- Parameter Golf 基準:要求在 8 個 H100 GPU 上 10 分鐘內訓練小模型;演講者用 Managed Agents + outcomes 驗證迴圈,讓 Opus 4.7 完成 20 次迭代並滿足所有實驗標準
- Pokémon 自學習實驗:Sonnet 3.5 有記憶工具訪問時遊戲進度有限且記憶質量差;Opus 4.6 記憶戰略性更強,進度更遠
- Continue Learning Bench:開源基準,測試模型在 SQL 資料庫順序問答中使用記憶改進效能;結果顯示高能力模型的關鍵差異是"distillation"——知道儲存什麼抽象以供未來使用
- Pokémon 陷阱門案例:raw memory 在 5/5 次復現中都因錯誤記憶導致定位偏差而墜入陷阱;dreaming 修正記憶後能正確通關
- Claude Tag:組織級 harness,所有員工共享訪問許可權、統一身份與憑證、可訪問組織級 context;支援主動告警、工作去重、內部研究、新員工零天快速上手
結論
結論“長時間自主工作的模型需要系統性的設計——腦手分離保證可靠性、獨立驗證修正幻覺、自由的記憶管理加離線糾正、組織級 harness 放大效能——這些原則的組合比單純的模型能力提升同樣重要。”
完整解析
詳細模型能力的長期擴充套件改變了代理產品的形態。在 2024 年 Opus 3 時代,模型只能獨立工作 10 到 20 分鐘,因此只有自動完成和聊天這樣需要人工緊密參與的互動模式才講得通。去年隨著同步編碼代理如 Claude Code 的興起,模型能做約一小時的工作,使得本地執行且使用者可隨時調整的架構成為可行。但真正需要非同步代理來解鎖的是數小時到十多小時的任務視野,這才是現在的發展方向。
為支援這種長時間自主執行,Anthropic 在 4 月釋出了 Managed Agents API,核心創新是將 harness(也就是決策的"腦")與執行環境(稱為"手")解耦開來。以前的容器架構把 harness 和 sandbox 放在一起,一旦容器崩潰就會丟失整個會話;現在 harness 變成無狀態程序,所有會話狀態儲存在僅追加的事件日誌中,而執行工作的容器可以是多個,credentials 存放在獨立的 vault。這種設計讓長時間執行既可靠又安全——即便某個環節失敗,會話歷史完整保留,憑證也無法洩露。會話日誌本質上成了一個外部 context 物件,模型可以隨時查詢和追加,這為長時間的 context 管理提供了更好的架構。
另一個關鍵洞察來自驗證問題。當用同一個 context 既做工作又自己給工作打分時,模型容易出現幻覺和自欺欺人的行為。解決方案是用獨立的驗證 context,由專門調優的驗證者來評估工作質量,直到滿足預定條件才結束迴圈。這種 build-verify 迴圈配合高能力模型非常有效,演講者用它在 Parameter Golf 基準上成功讓 Opus 4.7 完成 ML 研究任務。
第三個主題是記憶自學習。模型寫在記憶體中的記憶隨著模型能力提升而質量提升——高能力模型不只記錄戰術細節,而是學會提取能泛化到未來的策略性摘要。關鍵是給模型完全自由的記憶 substrate(如檔案系統或資料庫),讓它自己決定記什麼、怎麼組織,而不是預先規定記憶 schema。這是"bitter lesson"的體現:模型自己管理結構比人類精心設計的約束更有效。然而線上寫記憶也會犯錯,所以需要離線的 "dreaming" 過程來審視歷史會話和記憶庫,發現矛盾並糾正。Pokémon 遊戲的例子清晰展示了這一點:錯誤的位置記憶導致角色墜入陷阱,但 dreaming 修正這個錯誤後就能通關。
最後,非同步代理正在演進為組織級 harness。Claude Tag 的創新不僅是透過 Slack 訪問,而是建立了一個所有員工共享的統一智慧體,它有獨立的身份、組織級憑證和組織級 context。這讓新員工從第一天就能用充分配置好的工具,避免了個人代理需要幾周甚至幾個月才能完全配置的低效。同時,組織級 harness 可以是主動的,主動監控和告警,而不只是被動地響應使用者輸入。多人併發操作同一個 harness 也是新的互動模式。這些特性預示著非同步代理將不再只是個人生產力工具,而是組織整體協作和研究的基礎設施。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


