KeyFrame內部研究專用

Claude for Long-Horizon Tasks — Lance Martin, Anthropic

AI Engineer·7月22日週三英文

三句話摘要

Anthropic 的非同步代理設計理念:透過解耦架構、驗證迴圈、自學習記憶與組織級 harness,構建能獨立執行數小時到十多小時的智慧體。 長時間自主工作的模型需要系統性的設計——腦手分離保證可靠性、獨立驗證修正幻覺、自由的記憶管理加離線糾正、組織級 harness 放大效能——這些原則的組合比單純的模型能力提升同樣重要。 腦手分離保證長時間執行安全 — Managed Agents 將 harness 與 execution environments 分離,用 append-only event log 管理會話狀態。若某個容器或 harness 程序失敗,會話資料儲存在永久日誌中不會丟失,credentials 也存放在獨立的 vault 而非容器內,大幅降低了長時間執行的風險。

重點整理

重點
  • 1

    腦手分離保證長時間執行安全 — Managed Agents 將 harness 與 execution environments 分離,用 append-only event log 管理會話狀態。若某個容器或 harness 程序失敗,會話資料儲存在永久日誌中不會丟失,credentials 也存放在獨立的 vault 而非容器內,大幅降低了長時間執行的風險。

  • 2

    獨立驗證迴圈勝過自我評分 — 讓同一個 context 既產出工作又評分會導致幻覺與混淆。用獨立的驗證 context 和驗證者進行 build-verify 迴圈,驗證者可以針對評鑑任務專門調優,直到模型達成預定結果才停止迴圈。

  • 3

    模型原生管理自己的記憶比預設schema更有效 — 高能力模型學會寫更高階的、能泛化到未來任務的記憶摘要,而非僅記錄戰術細節。關鍵是給模型自由的記憶substrate(檔案系統或資料庫),讓模型自己決定存什麼、怎麼組織,而非預先定義記憶schema。

  • 4

    Dreaming 流程糾正in-band記憶的錯誤 — 模型寫記憶時會犯錯且這些錯誤會被鎖定。需要離線的 dreaming 過程(檢查歷史會話與記憶store,找出並修正矛盾),這樣非同步代理在多小時執行中遇到的錯誤記憶才能被捕捉和修復。

實用技巧與重點

乾貨
  • 任務視野演進:Opus 3 時代 10-20 分鐘;過去一年 1 小時;最新前沿模型 12+ 小時(根據 Meter 基準測試)
  • API 產品線演進:Message API(2 年前,簡單 prompt-response)→ Agents SDK(去年,程式設計呼叫 Claude Code)→ Managed Agents(4 月開始,完整 harness + 託管部署基礎設施)
  • Parameter Golf 基準:要求在 8 個 H100 GPU 上 10 分鐘內訓練小模型;演講者用 Managed Agents + outcomes 驗證迴圈,讓 Opus 4.7 完成 20 次迭代並滿足所有實驗標準
  • Pokémon 自學習實驗:Sonnet 3.5 有記憶工具訪問時遊戲進度有限且記憶質量差;Opus 4.6 記憶戰略性更強,進度更遠
  • Continue Learning Bench:開源基準,測試模型在 SQL 資料庫順序問答中使用記憶改進效能;結果顯示高能力模型的關鍵差異是"distillation"——知道儲存什麼抽象以供未來使用
  • Pokémon 陷阱門案例:raw memory 在 5/5 次復現中都因錯誤記憶導致定位偏差而墜入陷阱;dreaming 修正記憶後能正確通關
  • Claude Tag:組織級 harness,所有員工共享訪問許可權、統一身份與憑證、可訪問組織級 context;支援主動告警、工作去重、內部研究、新員工零天快速上手

結論

結論

長時間自主工作的模型需要系統性的設計——腦手分離保證可靠性、獨立驗證修正幻覺、自由的記憶管理加離線糾正、組織級 harness 放大效能——這些原則的組合比單純的模型能力提升同樣重要。

完整解析

詳細

模型能力的長期擴充套件改變了代理產品的形態。在 2024 年 Opus 3 時代,模型只能獨立工作 10 到 20 分鐘,因此只有自動完成和聊天這樣需要人工緊密參與的互動模式才講得通。去年隨著同步編碼代理如 Claude Code 的興起,模型能做約一小時的工作,使得本地執行且使用者可隨時調整的架構成為可行。但真正需要非同步代理來解鎖的是數小時到十多小時的任務視野,這才是現在的發展方向。

為支援這種長時間自主執行,Anthropic 在 4 月釋出了 Managed Agents API,核心創新是將 harness(也就是決策的"腦")與執行環境(稱為"手")解耦開來。以前的容器架構把 harness 和 sandbox 放在一起,一旦容器崩潰就會丟失整個會話;現在 harness 變成無狀態程序,所有會話狀態儲存在僅追加的事件日誌中,而執行工作的容器可以是多個,credentials 存放在獨立的 vault。這種設計讓長時間執行既可靠又安全——即便某個環節失敗,會話歷史完整保留,憑證也無法洩露。會話日誌本質上成了一個外部 context 物件,模型可以隨時查詢和追加,這為長時間的 context 管理提供了更好的架構。

另一個關鍵洞察來自驗證問題。當用同一個 context 既做工作又自己給工作打分時,模型容易出現幻覺和自欺欺人的行為。解決方案是用獨立的驗證 context,由專門調優的驗證者來評估工作質量,直到滿足預定條件才結束迴圈。這種 build-verify 迴圈配合高能力模型非常有效,演講者用它在 Parameter Golf 基準上成功讓 Opus 4.7 完成 ML 研究任務。

第三個主題是記憶自學習。模型寫在記憶體中的記憶隨著模型能力提升而質量提升——高能力模型不只記錄戰術細節,而是學會提取能泛化到未來的策略性摘要。關鍵是給模型完全自由的記憶 substrate(如檔案系統或資料庫),讓它自己決定記什麼、怎麼組織,而不是預先規定記憶 schema。這是"bitter lesson"的體現:模型自己管理結構比人類精心設計的約束更有效。然而線上寫記憶也會犯錯,所以需要離線的 "dreaming" 過程來審視歷史會話和記憶庫,發現矛盾並糾正。Pokémon 遊戲的例子清晰展示了這一點:錯誤的位置記憶導致角色墜入陷阱,但 dreaming 修正這個錯誤後就能通關。

最後,非同步代理正在演進為組織級 harness。Claude Tag 的創新不僅是透過 Slack 訪問,而是建立了一個所有員工共享的統一智慧體,它有獨立的身份、組織級憑證和組織級 context。這讓新員工從第一天就能用充分配置好的工具,避免了個人代理需要幾周甚至幾個月才能完全配置的低效。同時,組織級 harness 可以是主動的,主動監控和告警,而不只是被動地響應使用者輸入。多人併發操作同一個 harness 也是新的互動模式。這些特性預示著非同步代理將不再只是個人生產力工具,而是組織整體協作和研究的基礎設施。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。