Lessons from Studying Every Memory System — Shlok Khemani, Independent 2026-08-12 18:48
三句話摘要
AI 聊天應用記憶系統三年演進史:從單次手動記錄到自動運行檔案,ChatGPT 與 Claude 各自探索記憶架構的權衡方案。 記憶沒有唯一的最優架構,必須與產品同步設計,但無論技術多好,當前 AI 記憶系統因資訊孤島(各應用各自維護)與上下文缺陷(無法看見真實決策背景)而遠未達到「真正的個人 AI」應有的境界。 1. 記憶架構沒有標準答案
重點整理
重點- 1
1. 記憶架構沒有標準答案
- 2
ChatGPT 與 Claude 獨立發展出截然不同的方案:前者靠密集關鍵字的大型檔案,後者用輕量級完整句子,後來才逐漸收斂。這說明記憶系統必須與產品一同設計,無法外包給第三方。
- 3
2. 記憶是計算成本的直接函數
- 4
維護與服務費用受三個變數控制:更新頻率(越頻繁越貴)、每次更新的計算資源、檔案大小(越大每次對話成本越高)。ChatGPT 選擇較大檔案低更新頻率,Claude 則反向權衡,反映各自對資源成本的不同判斷。
- 5
3. 持續學習已經發生,但機制有限
- 6
運行檔案創造了一個學習循環:檔案→對話→新資訊→檔案更新→影響下次對話。但這發生在模型權重之外,無法像企業模型那樣定期重新訓練消費級模型。
- 7
4. 記憶資訊嚴重不完整
- 8
聊天應用只能收集透過文字對話的資訊,無法看到真實決策的背景(如面對面談話、郵件、行事曆、相片)。因此記憶常出現衝突且無法自動修正,系統也缺乏好奇心去追問這些缺陷。
實用技巧與重點
乾貨- ChatGPT 記憶系統
- v1(2024 年 2 月):用戶手動新增事實清單,可在設定中查看與刪除
- v2(2025 年 4 月):自動維護運行檔案,長度 4,000 代幣,密集關鍵字風格,每隔幾天更新一次,用戶無法查看原始檔案
- 更新(2025 年 6 月):新增對話搜尋工具、棄用 v1 事實清單、部分公開用戶檔案摘要、允許用戶明確修改檔案
- Claude 記憶系統
- v1(2025 年 8 月):無用戶檔案,模型備有按關鍵字或時間段搜尋對話的工具
- v2(2025 年 9 月):新增運行檔案,1,000 代幣(遠小於 ChatGPT)、完整句子風格(低密度)、每 24 小時更新一次、用戶可見原始檔案、支援用戶明確編輯
- 其他產品對比
- Google Gemini:運行檔案附帶詳細時間戳(建立時間、最後更新時間)
- 代理工具(如 Cloudflare Workers Code、OpenCrew、Hermes):使用 Markdown 檔案、心跳檢測、知識庫、技能等完全不同的記憶架構
- 講者實測案例
- 2025 年夏天旅遊決策:聊天 GPT 誤記講者同時「計畫」去泰國和土耳其(實際只去了泰國,決策來自與伴侶面對面談話),記憶檔案無法修正這項衝突,即使連接郵件也不會自動推理更新
結論
結論“記憶沒有唯一的最優架構,必須與產品同步設計,但無論技術多好,當前 AI 記憶系統因資訊孤島(各應用各自維護)與上下文缺陷(無法看見真實決策背景)而遠未達到「真正的個人 AI」應有的境界。”
完整解析
詳細在過去三年間,消費級 AI 的記憶系統經歷了一場工程權衡的競賽。2023 年時,ChatGPT 雖然強大,但不同對話之間完全隔離。隨著用戶基數擴大,人們用它學習、烹飪、尋求陪伴,記憶系統的需求變得迫切。
ChatGPT 在 2024 年 2 月推出首個記憶系統,讓用戶告訴它要記住什麼——比如「我是素食主義者」。看似簡單,卻有根本缺陷:一是管理負擔落在用戶肩上(既要創建記憶,又要進行對話),二是記憶會陳舊(講者的檔案至今仍記錄已過時的計畫)。
一年多後,ChatGPT 在 2025 年 4 月推出 v2,轉向自動維護一份「運行檔案」——每隔幾天,系統掃描所有新對話,提取重要資訊,更新關於用戶的個人檔案。這個檔案長達 4,000 代幣,採用密集關鍵字風格(LLM 擅長從線索推斷上下文)。講者注意到這種設計試圖把盡可能多的上下文壓進每條記憶。然而用戶看不到原始檔案,只有通過「越獄」提示才能窺視。
與此同時,Claude 在 2025 年 8 月發布了截然不同的方案:沒有用戶檔案,改由模型掌握按關鍵字或時間段搜尋過去對話的工具。當模型覺得需要上下文時,主動檢索。這個架構與 ChatGPT 「完全相反」——講者甚至在 9 月 11 日寫了篇部落格文章到駭客新聞首頁討論這點。但同天,Claude 推出了 v2,加入了運行檔案,卻也有所不同:檔案只有 1,000 代幣、用完整句子而非密集關鍵字、每 24 小時固定更新、用戶完全可見。
這些權衡反映了一個深刻洞察:記憶是計算能力的直接函數。維護檔案需要代幣(更新頻率越高越貴),提供服務也需要代幣(檔案越長每次對話越貴)。ChatGPT 選擇大檔案低更新頻率,Claude 反其道而行,各自在 GPU 資源受限的現實中做出取捨。
但最令人沮喪的問題是上下文的根本不完整性。講者舉例:他最終決定去泰國是與伴侶面對面談話的結果,但聊天 GPT 只看得到他在對話中糾結該去泰國還是土耳其。相關証據在郵件中(機票、飯店預訂),卻無法被系統推理。即使 ChatGPT 連接了郵件,它也不會用郵件信息更新檔案。更深層的問題是,系統缺乏好奇心去認識這個衝突,無法問「你最後選了哪個?」。講者認為這不是技術問題,而是產品設計選擇——LLM 本身沒有根本障礙,只是產品未被設計成這樣。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


