KeyFrame內部研究專用

Active Graph Agent Runtime (BabyAGI 4) — Yohei Nakajima, Untapped Capital

AI Engineer·7月22日週三英文

三句話摘要

ActiveGraph:以事件日誌為中心的圖形運行時,用於構建可自改進且可審計的 AI agent。 長期運行的 AI agent 需要的不只是預測世界模型,更需要以自身經歷日誌為基礎的「經驗世界模型」——人類也是由生活經驗而非單純推理能力定義的,agent 應該也是如此。 架構哲學反轉:傳統 agent 圍繞 LLM 構建(工具→記憶→日誌),ActiveGraph 反過來以單一不可變事件日誌為唯一真實來源。所有 agent 變化都被追蹤,包括提示詞編輯、事實修改,投影成 agent 的實時狀態。

重點整理

重點
  • 1

    架構哲學反轉:傳統 agent 圍繞 LLM 構建(工具→記憶→日誌),ActiveGraph 反過來以單一不可變事件日誌為唯一真實來源。所有 agent 變化都被追蹤,包括提示詞編輯、事實修改,投影成 agent 的實時狀態。

  • 2

    反應式行為架構:Behaviors 監聽圖變化並發出事件,不同於傳統的循環型 agent 設計。LLM 不直接通訊,而通過共享狀態進行通訊,類似 Kafka 或 70 年代 Blackboard 架構。現在 AI 能更好地架構這類系統,因為相關知識在訓練數據中有豐富的 decades-old 討論。

  • 3

    策略驅動的變更控制:通過 Policies 定義什麼可自動執行(如添加文章)、什麼需人工審核(如編輯提示詞)、什麼需驗證約束(如檢查事實衝突)。系統會提出變更建議、靜態檢查、沙盒驗證,確認效果後才接受。

  • 4

    自改進的量化驗證:Regimes 項目在 LongBench eval 上,系統將失敗分類、選擇性修改、在 50 題測試集驗證、只在準確率上升時接受補丁。8-13 次循環中僅接受 4-5 個補丁,卻帶來統計顯著的提升,且系統知道什麼有效、什麼無效。

實用技巧與重點

乾貨
  • 核心概念
  • Event-sourced Graph Runtime(事件溯源圖運行時)
  • Immutable typed event log(不可變類型事件日誌)
  • Behaviors:監聽圖變化、發出事件的反應式組件
  • Policies:控制圖修改規則
  • Views:圖查詢作為上下文管理
  • Relation Behaviors:邊上的行為
  • Packs:可組合模塊(core、tool、secret、memory、identity、communication、chat)
  • 主要實驗與成果
  • | 項目 | 方法 | 結果 |
  • |------|------|------|
  • | LongBench eval | 結構化日誌作為記憶 + 嵌入查詢 | 不錯成績,無需語義提取 |
  • | Regimes(自改進) | 失敗分類→選擇修改→50 題驗證→接受判定 | 8-13 循環接受 4-5 補丁,統計顯著提升 |
  • | ActiveGraph Lab | 自動讀博客→提實驗建議→運行→寫博文 | 發現自己代碼錯誤、自動修復、提 PR |
  • | Pokemon 卡牌(Kaggle) | 80 次通過,每次模擬 200 局對 3 個 AI | 接受 20-30 變更,分數逐步至 27% |
  • 關鍵驚喜
  • API key 耗盡時能從中斷處恢復(第 350→353 題),不需重新開始
  • 調試自動轉向 ActiveGraphDB 而非會話日誌
  • Packs 可輕易從其他倉庫加載

結論

結論

長期運行的 AI agent 需要的不只是預測世界模型,更需要以自身經歷日誌為基礎的「經驗世界模型」——人類也是由生活經驗而非單純推理能力定義的,agent 應該也是如此。

完整解析

詳細

ActiveGraph 改變了構建 AI agent 的根本方式。傳統方法圍繞 LLM 設計——先有模型,再附加工具、記憶與日誌機制。ActiveGraph 反過來提問:如果我們圍繞日誌構建呢?這不只是追蹤 agent 的行為,更重要的是追蹤 agent 如何演變。因為沒有人用一年前的 agent 配置,所以 ActiveGraph 將所有變化都記入單一不可變事件日誌,使其成為 agent 的唯一真實來源。

系統的核心是「行為」(Behaviors)——監聽圖狀態變化的反應式組件。當行為被觸發時,它發出事件,這些事件更新 agent 狀態並可能觸發其他行為。關鍵的是 LLM 不直接通訊,而是通過共享狀態進行通訊。這種架構源自 70-80 年代的 Blackboard 設計與現代 Kafka——許多微型工作者通過共享黑板通訊。過去這很難手寫代碼,但 AI 在這方面表現出色,因為decades的系統設計知識已在訓練數據中。

系統通過「政策」控制圖修改。例如,找到的源文章可自動添加,但編輯提示詞可能需人工審核,修改事實則需確保無衝突。自改進循環利用這機制:系統提出變更、進行靜態檢查、在沙盒中驗證、確認效果後才接受。在 Regimes 項目中,系統在 LongBench 評估上進行 8-13 次循環,每次對 50 道題進行變更測試,只在準確率提升時接受修改。結果顯示 4-5 個接受的補丁帶來統計顯著的改進,且系統能追蹤所有失敗的嘗試。

ActiveGraph Lab 則演示了自改進的另一層次——系統自動研究 ActiveGraph 本身。它讀取博客文章、提出實驗建議、運行實驗、撰寫總結。過程中它發現了自己代碼中的錯誤、自動修復並提交 PR。這表明當系統能原生追蹤所有變化時,自改進變成自然而然的功能。Pokemon 卡牌實驗也展示類似模式:AI 提出微調(如增加能量卡),系統模擬 200 局對不同對手驗證,用 Wilson score 判定是否接受。80 次通過接受 20-30 個變更,分數逐步改進。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。