KeyFrame內部研究專用

Lessons from Studying Every Memory System — Shlok Khemani, Independent 2026-08-12 18:48

AI Engineer·8月12日週三·19 min中文

三句話摘要

AI 聊天應用記憶系統三年演進史:從單次手動記錄到自動運行檔案,ChatGPT 與 Claude 各自探索記憶架構的權衡方案。 記憶沒有唯一的最優架構,必須與產品同步設計,但無論技術多好,當前 AI 記憶系統因資訊孤島(各應用各自維護)與上下文缺陷(無法看見真實決策背景)而遠未達到「真正的個人 AI」應有的境界。 1. 記憶架構沒有標準答案

重點整理

重點
  • 1

    1. 記憶架構沒有標準答案

  • 2

    ChatGPT 與 Claude 獨立發展出截然不同的方案:前者靠密集關鍵字的大型檔案,後者用輕量級完整句子,後來才逐漸收斂。這說明記憶系統必須與產品一同設計,無法外包給第三方。

  • 3

    2. 記憶是計算成本的直接函數

  • 4

    維護與服務費用受三個變數控制:更新頻率(越頻繁越貴)、每次更新的計算資源、檔案大小(越大每次對話成本越高)。ChatGPT 選擇較大檔案低更新頻率,Claude 則反向權衡,反映各自對資源成本的不同判斷。

  • 5

    3. 持續學習已經發生,但機制有限

  • 6

    運行檔案創造了一個學習循環:檔案→對話→新資訊→檔案更新→影響下次對話。但這發生在模型權重之外,無法像企業模型那樣定期重新訓練消費級模型。

  • 7

    4. 記憶資訊嚴重不完整

  • 8

    聊天應用只能收集透過文字對話的資訊,無法看到真實決策的背景(如面對面談話、郵件、行事曆、相片)。因此記憶常出現衝突且無法自動修正,系統也缺乏好奇心去追問這些缺陷。

實用技巧與重點

乾貨
  • ChatGPT 記憶系統
  • v1(2024 年 2 月):用戶手動新增事實清單,可在設定中查看與刪除
  • v2(2025 年 4 月):自動維護運行檔案,長度 4,000 代幣,密集關鍵字風格,每隔幾天更新一次,用戶無法查看原始檔案
  • 更新(2025 年 6 月):新增對話搜尋工具、棄用 v1 事實清單、部分公開用戶檔案摘要、允許用戶明確修改檔案
  • Claude 記憶系統
  • v1(2025 年 8 月):無用戶檔案,模型備有按關鍵字或時間段搜尋對話的工具
  • v2(2025 年 9 月):新增運行檔案,1,000 代幣(遠小於 ChatGPT)、完整句子風格(低密度)、每 24 小時更新一次、用戶可見原始檔案、支援用戶明確編輯
  • 其他產品對比
  • Google Gemini:運行檔案附帶詳細時間戳(建立時間、最後更新時間)
  • 代理工具(如 Cloudflare Workers Code、OpenCrew、Hermes):使用 Markdown 檔案、心跳檢測、知識庫、技能等完全不同的記憶架構
  • 講者實測案例
  • 2025 年夏天旅遊決策:聊天 GPT 誤記講者同時「計畫」去泰國和土耳其(實際只去了泰國,決策來自與伴侶面對面談話),記憶檔案無法修正這項衝突,即使連接郵件也不會自動推理更新

結論

結論

記憶沒有唯一的最優架構,必須與產品同步設計,但無論技術多好,當前 AI 記憶系統因資訊孤島(各應用各自維護)與上下文缺陷(無法看見真實決策背景)而遠未達到「真正的個人 AI」應有的境界。

完整解析

詳細

在過去三年間,消費級 AI 的記憶系統經歷了一場工程權衡的競賽。2023 年時,ChatGPT 雖然強大,但不同對話之間完全隔離。隨著用戶基數擴大,人們用它學習、烹飪、尋求陪伴,記憶系統的需求變得迫切。

ChatGPT 在 2024 年 2 月推出首個記憶系統,讓用戶告訴它要記住什麼——比如「我是素食主義者」。看似簡單,卻有根本缺陷:一是管理負擔落在用戶肩上(既要創建記憶,又要進行對話),二是記憶會陳舊(講者的檔案至今仍記錄已過時的計畫)。

一年多後,ChatGPT 在 2025 年 4 月推出 v2,轉向自動維護一份「運行檔案」——每隔幾天,系統掃描所有新對話,提取重要資訊,更新關於用戶的個人檔案。這個檔案長達 4,000 代幣,採用密集關鍵字風格(LLM 擅長從線索推斷上下文)。講者注意到這種設計試圖把盡可能多的上下文壓進每條記憶。然而用戶看不到原始檔案,只有通過「越獄」提示才能窺視。

與此同時,Claude 在 2025 年 8 月發布了截然不同的方案:沒有用戶檔案,改由模型掌握按關鍵字或時間段搜尋過去對話的工具。當模型覺得需要上下文時,主動檢索。這個架構與 ChatGPT 「完全相反」——講者甚至在 9 月 11 日寫了篇部落格文章到駭客新聞首頁討論這點。但同天,Claude 推出了 v2,加入了運行檔案,卻也有所不同:檔案只有 1,000 代幣、用完整句子而非密集關鍵字、每 24 小時固定更新、用戶完全可見。

這些權衡反映了一個深刻洞察:記憶是計算能力的直接函數。維護檔案需要代幣(更新頻率越高越貴),提供服務也需要代幣(檔案越長每次對話越貴)。ChatGPT 選擇大檔案低更新頻率,Claude 反其道而行,各自在 GPU 資源受限的現實中做出取捨。

但最令人沮喪的問題是上下文的根本不完整性。講者舉例:他最終決定去泰國是與伴侶面對面談話的結果,但聊天 GPT 只看得到他在對話中糾結該去泰國還是土耳其。相關証據在郵件中(機票、飯店預訂),卻無法被系統推理。即使 ChatGPT 連接了郵件,它也不會用郵件信息更新檔案。更深層的問題是,系統缺乏好奇心去認識這個衝突,無法問「你最後選了哪個?」。講者認為這不是技術問題,而是產品設計選擇——LLM 本身沒有根本障礙,只是產品未被設計成這樣。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。