KeyFrame內部研究專用

Memory Harnesses for Long-Running Research Agents — Stefania Druga, Sakana.ai

AI Engineer·8月12日週三·13 min中文

三句話摘要

設計長期運行AI研究代理的記憶管理系統,在本地模型上實現高效的上下文檢索。 在本地模型時代,設計好的記憶檢索策略比單純堆砌記憶儲存更有價值,而「記憶優先度」應該成為AI系統設計的一級指標。 記憶不總是需要的:當所有相關資訊都能放入上下文視窗時,記憶系統反而只增加成本而無效益提升;只有當任務範圍超出上下文容量時,好的記憶管理才能發揮價值。

重點整理

重點
  • 1

    記憶不總是需要的:當所有相關資訊都能放入上下文視窗時,記憶系統反而只增加成本而無效益提升;只有當任務範圍超出上下文容量時,好的記憶管理才能發揮價值。

  • 2

    架構設計是控制迴圈:把記憶視為環繞模型的讀寫管理迴圈,而非單純資料庫存儲,包含追蹤、回憶和檔案三個核心模塊,讓記憶檢索成為系統的可控變數。

  • 3

    排序策略優於簡單檢索:相比無差別的向量RAG或固定規則,基於決策账本的排序回憶策略既提升準確度(在XBench基準上性能最優),也降低token成本,驗證了「壞記憶是昂貴的」這一直覺。

  • 4

    本地模型的主權優勢:在本地運行讓講者能完全控制資料、計算流程與評估,雖然無法批量查詢且耗時較長,但為記憶系統的可控性與隱私性提供了獨特價值。

實用技巧與重點

乾貨
  • 硬體配置:Mac M3 Ultra,96GB RAM,28核CPU
  • 模型:Qwen 27B(4位量化)、Deepseek v4 Flash
  • 基準測試:XBench(長期任務記憶基準)、Spider V2(資料庫查詢基準)
  • 回憶策略階梯(測試順序):
  • 無回憶(基準線)
  • 向量RAG相似度檢索
  • 決策账本(追蹤每回合決策)
  • 預言機(地面真實)
  • XBench測試規模:68個問題,多組種子,多重單元測試
  • 場景案例:答案位於步驟124,問題在步驟500(完全超出上下文窗口)
  • Coinbase案例:通過遷移至本地模型、改善路由/快取/上下文管理,同時降低AI成本與提升使用量
  • 論文案例:Nature論文聲稱發現742,000個有希望的材料,後被撤回(測試記憶系統在應對誤導性聲明時的表現)
  • 相關研究:Diamond repository收錄超過30份記憶相關論文

結論

結論

在本地模型時代,設計好的記憶檢索策略比單純堆砌記憶儲存更有價值,而「記憶優先度」應該成為AI系統設計的一級指標。

完整解析

詳細

Stefania Druogh今年的研究針對一個日益迫切的問題:隨著AI任務的時間跨度越來越長,而新的基礎模型發布卻越來越稀少,AI代理如何有效地管理和回憶已完成的工作。這個問題在本地模型時代變得尤為重要——Coinbase最近展示了如何通過遷移至開源本地模型、改善快取與上下文管理,在提高AI使用量的同時反而降低了成本。

為了研究這個課題,她在一台Mac M3 Ultra上進行了一系列實驗,搭載96GB記憶體和28核CPU,運行Qwen 27B(4位量化)和Deepseek v4 Flash兩個開源模型。她提出的記憶架構的核心理念是:不把記憶簡單地看作資料庫,而是圍繞模型的一個讀寫管理迴圈。這個迴圈包含三個部分——即時追蹤(traces)、回憶策略(recall block,實驗不同的檢索方式)和檔案庫(archival block,跨會話的長期存儲)。

在回憶策略上,她設計了一個「階梯測試」,逐步遞進地測試四種方案:完全無記憶、向量RAG相似度檢索、基於決策账本的排序檢索(追蹤每個回合做出的決策),以及預言機式的地面真實(告訴模型正確答案作為參考基線)。她在兩個基準測試上驗證了這個方案:一是文獻審查任務(包含一篇後來被撤回的Nature論文,聲稱發現742,000個有希望的材料),二是XBench這個專門測試長期任務記憶的基準。

最有趣的發現是,記憶系統並非永遠有效。在文獻審查任務中,由於所有相關資訊都能放入模型上下文,加入記憶系統並未提升性能,反而因為額外的token消耗而增加了成本。但在XBench的測試中,當問題在步驟500被提出,而正確答案則位於步驟124時(完全超出上下文窗口),基於決策账本排序的回憶策略顯著超越了其他方案,甚至超過了預言機基線——因為預言機雖然提供正確記憶,但模型仍可能選擇忽略或誤解。這驗證了一個關鍵直覺:壞的記憶系統既浪費token又降低性能,而好的結構化記憶策略既能提升準確度,還能節省成本。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。