KeyFrame內部研究專用

The Log Is The Agent - Ishaan Sehgal, Omnara

AI Engineer·6月25日週四·15 min英文

三句話摘要

代理的身份不是其模型或執行環境,而是它的執行日誌;日誌應該是代理系統的第一級原語。 把日誌視為代理的第一級系統原語,而非執行的副產物,自然產生可靠性、可擴展性、分叉和協作能力,同時消解了所有權綁定風險。 1. 日誌是代理的身份

重點整理

重點
  • 1

    1. 日誌是代理的身份

  • 2

    就像 Skyrim 遊戲角色的身份在於存檔文件而非遊戲機或控制器,代理的身份在於其日誌。日誌記錄了代理所做的一切、所見的一切,以及恢復所需的狀態。拆換模型、運行時或機器都無關緊要,因為日誌是不變的記錄。

  • 3

    2. 系統應圍繞日誌反轉設計

  • 4

    當前代理系統把日誌視為副作用,應改為把日誌作為主要對象。所有投影(UI、偵錯、審計、壓縮)都來自日誌,而非相反。這反映了成熟數據庫的架構方式:日誌是堅實基礎,索引和物化視圖都是投影。

  • 5

    3. 日誌賦予無狀態執行能力

  • 6

    工作進程可以聲稱一個會話、讀取日誌、將代理向前推進一步、寫入結果後消失。任何其他工作進程稍後都能接手恢復該狀態。這導致可靠性(權限提示不會遺失)、可擴展性(一個進程可推進數千個代理)、分叉(在不同分支嘗試不同模型或策略)自然成立。

  • 7

    4. 日誌所有權是最深層的綁定

  • 8

    模型可更換、工具可適配,但若供應商擁有日誌,他們實際上擁有了代理及其所有個人/公司數據、工作流程和決策。長期而言日誌最有價值,因為模型、運行時和機器都可替換。

實用技巧與重點

乾貨
  • 核心概念
  • 日誌:不可追加的事件歷史,包含用戶輸入、模型輸出、工具調用、工具結果、權限失敗
  • 簡化執行循環:重建狀態 → 傳遞給模型 → 模型提議下一步 → 追加到日誌 → 執行工具 → 追加結果 → 重複
  • 壓縮與外部狀態
  • 壓縮是有損投影,非完美狀態縮小;應保留原始日誌,壓縮為新日誌恢復點
  • 日誌記錄代理的視角,不能包含整個世界;代理外部的狀態變化(郵件已發、檔案已改)不可逆
  • 現有系統的問題
  • Claude Code/Codex:本地 JSON Lines 文件,寫入失敗則資料遺失
  • OpenCode:SQLite 狀態文件,存在資料損壞和丟失的問題
  • Durable Objects:不同分片導致歷史難以重建和跨會話查詢
  • Omnara 的架構
  • 組件圍繞會話日誌協調
  • 工作進程調用模型提供商→取結果→寫回日誌→分派工具→追加結果
  • 用戶完全擁有、檢查和控制日誌
  • 開源管理代理平台計畫發佈
  • 網址:omnara.com/managed

結論

結論

把日誌視為代理的第一級系統原語,而非執行的副產物,自然產生可靠性、可擴展性、分叉和協作能力,同時消解了所有權綁定風險。

完整解析

詳細

講者以電視遊戲角色類比開場,指出 Skyrim 存檔文件才是角色真正的身份,而非遊戲引擎或主機。這個比喻引入核心觀點:代理的身份是其日誌,一份完整的執行歷史記錄。

日誌的運作方式很直白。工作進程從日誌讀取狀態、將其傳遞給語言模型、模型提議下一行動、結果被追加回日誌、工具若需執行也被追加、整個迴圈在下一個工作進程接手時重復。此設計的妙處在於工作進程是無狀態的、可拋棄的,任何機器上的任何進程都能恢復一個會話。這正是把日誌設為系統主體而非副作用的結果。

講者借用數據庫的歷史論證。多年來數據庫看似複雜不透明的系統,但核心其實是一份日誌——持久化的變更序列。索引、物化視圖等都是投影。代理系統需要相同的反轉:日誌是主體,UI、偵錯、審計、壓縮都是投影。這帶來自然的屬性:一個進程可推進數千個代理,無須綁定到單一機器;代理可跨模型分叉,每條分支探索不同策略;協作變為共享日誌訪問;遷移變為適配問題而非身份問題。

日誌確實面臨兩個挑戰。其一是壓縮:上下文窗口有限,無法讓模型讀取無限日誌。但壓縮是有損的,只應保留原始日誌;壓縮後若丟棄原始日誌,就永久遺失了資訊。其二是日誌外狀態:代理編輯檔案、發送郵件,這些變化不在日誌內。但日誌的職責是記錄代理所做所見,不是讓世界確定性——代理無法追回已發的郵件,但日誌能記錄發生了什麼。

講者批評現有代理基礎設施多把日誌視為副作用。Claude Code 寫本地 JSON Lines 文件且無保障、OpenCode 因 SQLite 腐壞問題頻繁出現、Durable Objects 因分片結構破壞歷史連貫性。真正的風險是所有權:若供應商擁有日誌,他們實際上擁有了代理及其所有敏感數據和工作流程。Omnara 的方案是圍繞會話日誌建築系統,確保用戶完全控制,並準備開源其管理代理平台。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。