Active Graph Agent Runtime (BabyAGI 4) — Yohei Nakajima, Untapped Capital
三句話摘要
ActiveGraph:以事件日誌為中心的圖形運行時,用於構建可自改進且可審計的 AI agent。 長期運行的 AI agent 需要的不只是預測世界模型,更需要以自身經歷日誌為基礎的「經驗世界模型」——人類也是由生活經驗而非單純推理能力定義的,agent 應該也是如此。 架構哲學反轉:傳統 agent 圍繞 LLM 構建(工具→記憶→日誌),ActiveGraph 反過來以單一不可變事件日誌為唯一真實來源。所有 agent 變化都被追蹤,包括提示詞編輯、事實修改,投影成 agent 的實時狀態。
重點整理
重點- 1
架構哲學反轉:傳統 agent 圍繞 LLM 構建(工具→記憶→日誌),ActiveGraph 反過來以單一不可變事件日誌為唯一真實來源。所有 agent 變化都被追蹤,包括提示詞編輯、事實修改,投影成 agent 的實時狀態。
- 2
反應式行為架構:Behaviors 監聽圖變化並發出事件,不同於傳統的循環型 agent 設計。LLM 不直接通訊,而通過共享狀態進行通訊,類似 Kafka 或 70 年代 Blackboard 架構。現在 AI 能更好地架構這類系統,因為相關知識在訓練數據中有豐富的 decades-old 討論。
- 3
策略驅動的變更控制:通過 Policies 定義什麼可自動執行(如添加文章)、什麼需人工審核(如編輯提示詞)、什麼需驗證約束(如檢查事實衝突)。系統會提出變更建議、靜態檢查、沙盒驗證,確認效果後才接受。
- 4
自改進的量化驗證:Regimes 項目在 LongBench eval 上,系統將失敗分類、選擇性修改、在 50 題測試集驗證、只在準確率上升時接受補丁。8-13 次循環中僅接受 4-5 個補丁,卻帶來統計顯著的提升,且系統知道什麼有效、什麼無效。
實用技巧與重點
乾貨- 核心概念
- Event-sourced Graph Runtime(事件溯源圖運行時)
- Immutable typed event log(不可變類型事件日誌)
- Behaviors:監聽圖變化、發出事件的反應式組件
- Policies:控制圖修改規則
- Views:圖查詢作為上下文管理
- Relation Behaviors:邊上的行為
- Packs:可組合模塊(core、tool、secret、memory、identity、communication、chat)
- 主要實驗與成果
- | 項目 | 方法 | 結果 |
- |------|------|------|
- | LongBench eval | 結構化日誌作為記憶 + 嵌入查詢 | 不錯成績,無需語義提取 |
- | Regimes(自改進) | 失敗分類→選擇修改→50 題驗證→接受判定 | 8-13 循環接受 4-5 補丁,統計顯著提升 |
- | ActiveGraph Lab | 自動讀博客→提實驗建議→運行→寫博文 | 發現自己代碼錯誤、自動修復、提 PR |
- | Pokemon 卡牌(Kaggle) | 80 次通過,每次模擬 200 局對 3 個 AI | 接受 20-30 變更,分數逐步至 27% |
- 關鍵驚喜
- API key 耗盡時能從中斷處恢復(第 350→353 題),不需重新開始
- 調試自動轉向 ActiveGraphDB 而非會話日誌
- Packs 可輕易從其他倉庫加載
結論
結論“長期運行的 AI agent 需要的不只是預測世界模型,更需要以自身經歷日誌為基礎的「經驗世界模型」——人類也是由生活經驗而非單純推理能力定義的,agent 應該也是如此。”
完整解析
詳細ActiveGraph 改變了構建 AI agent 的根本方式。傳統方法圍繞 LLM 設計——先有模型,再附加工具、記憶與日誌機制。ActiveGraph 反過來提問:如果我們圍繞日誌構建呢?這不只是追蹤 agent 的行為,更重要的是追蹤 agent 如何演變。因為沒有人用一年前的 agent 配置,所以 ActiveGraph 將所有變化都記入單一不可變事件日誌,使其成為 agent 的唯一真實來源。
系統的核心是「行為」(Behaviors)——監聽圖狀態變化的反應式組件。當行為被觸發時,它發出事件,這些事件更新 agent 狀態並可能觸發其他行為。關鍵的是 LLM 不直接通訊,而是通過共享狀態進行通訊。這種架構源自 70-80 年代的 Blackboard 設計與現代 Kafka——許多微型工作者通過共享黑板通訊。過去這很難手寫代碼,但 AI 在這方面表現出色,因為decades的系統設計知識已在訓練數據中。
系統通過「政策」控制圖修改。例如,找到的源文章可自動添加,但編輯提示詞可能需人工審核,修改事實則需確保無衝突。自改進循環利用這機制:系統提出變更、進行靜態檢查、在沙盒中驗證、確認效果後才接受。在 Regimes 項目中,系統在 LongBench 評估上進行 8-13 次循環,每次對 50 道題進行變更測試,只在準確率提升時接受修改。結果顯示 4-5 個接受的補丁帶來統計顯著的改進,且系統能追蹤所有失敗的嘗試。
ActiveGraph Lab 則演示了自改進的另一層次——系統自動研究 ActiveGraph 本身。它讀取博客文章、提出實驗建議、運行實驗、撰寫總結。過程中它發現了自己代碼中的錯誤、自動修復並提交 PR。這表明當系統能原生追蹤所有變化時,自改進變成自然而然的功能。Pokemon 卡牌實驗也展示類似模式:AI 提出微調(如增加能量卡),系統模擬 200 局對不同對手驗證,用 Wilson score 判定是否接受。80 次通過接受 20-30 個變更,分數逐步改進。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


