Turn 10,994 Notes Into Memory - Paul Iusztin, Decoding AI & Louis-François Bouchard, Towards AI
三句話摘要
如何建立個人化AI研究作業系統,用活態Wiki和檔案系統連接第二大腦與智能代理 用檔案驅動的活態Wiki讓AI代理持久復用你的研究積累,是破解大規模知識管理和深度多輪研究的關鍵。 現有AI工具的根本限制在於無法持久化個人研究。ChatGPT、Claude等每次對話都丟失上下文,即便同樣的PDF和筆記下次還要重新提供。這阻斷了跨項目的知識復用和多輪深度研究的延續性。
重點整理
重點- 1
現有AI工具的根本限制在於無法持久化個人研究。ChatGPT、Claude等每次對話都丟失上下文,即便同樣的PDF和筆記下次還要重新提供。這阻斷了跨項目的知識復用和多輪深度研究的延續性。
- 2
系統經歷三代演進。第一版輸入主題+手選黃金連結,通過多agent並行搜索產出靜態MD檔。第二版轉向個人第二大腦(Obsidian、Readwise等),無需手選就能自動蒐集相關資源。第三版加入Wiki層——不再是靜態快照,而是活態知識圖,每次查詢都會自動衍生新的概念、比較、實體筆記。
- 3
檔案優先設計大幅降低複雜度。採用Index.yml作統一入口(包含所有來源摘要和元資料),代理通過三層梯級查詢:先檢視摘要→再查Wiki概念/實體/比較→最後才讀完整原始文件。這個設計極大節省Token消耗,同時所有內容人可檢查、可編輯。
- 4
多源整合能力強。系統可自動爬取Obsidian個人筆記、Readwise高亮筆記、Notebook LM、GitHub程式碼倉庫、YouTube影片逐字稿、自訂URL等,深度研究演算法會多輪並行從你的第二大腦和公網同時蒐集資料。
實用技巧與重點
乾貨- 規模參考:Paul的Obsidian 5000筆記+Readwise 5000筆記,每月增長250檔案
- 專案名稱:AI Research OS Workshop Repository(開源)
- 深度研究參數配置:
- Light級:1輪,每輪3查詢
- Fast級:2輪,每輪3查詢
- Deep級:更多輪次(具體數字未明確指出)
- 執行時長:10–20分鐘
- 結果規模:6輪查詢約產出40–50個連結
- 三層檔案結構:
- /raw:原始不可變資料
- /wiki:LLM衍生內容(comparisons、concepts、entities、source summaries、open questions)
- Index.yml:索引入口點
- 支援資料來源:Obsidian、Readwise、Notebook LM、GitHub repo、YouTube、Google Drive、Notion、自訂URL、Slack(計畫中)
- 筆記組織方法:PARA法(Projects、Areas、Resources、Archive)
- 排名演算法:將每個來源與初始主題比對,提取高訊號資訊
- 擴展學習:Agent Engineering課程,60小時完成,含類似多代理深度研究系統的實作
- 核心選擇:不用向量數據庫、知識圖譜、語義搜尋,改用純檔案系統和引用機制
結論
結論“用檔案驅動的活態Wiki讓AI代理持久復用你的研究積累,是破解大規模知識管理和深度多輪研究的關鍵。”
完整解析
詳細Paul和Luis共同面臨一個知識焦慮:龐大的第二大腦(Paul跨Obsidian和Readwise共10000筆筆記,Luis則分散在Obsidian、會議軟體、手機備忘錄等)在實際工作中卻形同虛設。每當啟動新文章、新影片或新課程時,他們必須手動搜尋相關筆記,或在ChatGPT、Claude等工具中反覆貼上相同PDF和連結。換個對話,這些精心蒐集的資料就全部遺失。最要命的是,系統無法反映他們的個人價值觀和思維脈絡——它只是通用的、無感的。
他們著手設計了一套進化式系統。第一代方案是深度研究流程:給定主題和手工挑選的「黃金連結」,系統啟動一個主編排agent生成多個相關問題,再由多個worker agent分別搜索Google(用Gemini驅動),每個agent收集多個資源並生成摘要,最後編排agent聚合所有資訊做排名篩選。這一版用於課程教材開發時效率驚人——35堂課快速生成。但每份產出都是孤立的MD快照,無法交叉復用。
第二版的洞察是:何不把搜索範圍擴大到個人第二大腦?黃金連結不用手選,它們應該是個人資料庫的有機累積。系統改為輸入主題,自動檢索Obsidian(個人筆記)、Readwise(保存的高亮)、Notebook LM、GitHub等。深度研究演算法保持不變,只是數據源從單純的公網擴展到第二大腦+公網。這解決了個性化問題,但仍然產出靜態文件。
第三版引入Wiki層是關鍵突破。系統不再產出單一MD檔案。相反,它首先將所有抓取的原始內容保存到/raw資料夾(immutable),為每個來源自動生成executive summary存入/wiki/sources。然後——這是神奇之處——LLM會自動從這堆資料中提煉高階衍生物:comparisons(如「agentic RAG vs 檔案系統」),concepts(agent loop、context compaction、memory systems等),entities(OpenCode、MCP等)。所有這些都被串聯起來形成一個活態知識圖。
查詢設計極其精妙。當提出問題時,代理首先讀Index.yml,查看摘要和元資料——許多淺層問題就此解決,零成本。如果找不著答案,就進階讀source wiki pages(每個來源的擴展摘要)。還是不夠就查相關的concepts、comparisons、entities衍生頁面。只有必要時才讀完整的原始文件。這個三層梯級設計使得99%的查詢都不需要碰到原始內容,Token消耗驚人地低。
最美妙的是Wiki活態特性。每一次提問都留下蹤跡。系統可能自動創建新的概念筆記、比較、實體筆記。這反映了使用者思維的演進、遺漏的問題、未理解的地帶。整個系統因使用而變得更加個性化和豐富。同時,因為完全基於檔案和引用,沒有向量數據庫、沒有黑盒,所有內容透明可檢查。
實戰演示涵蓋三個場景。場景一:針對agentic engineering文章,提供已有筆記和參考連結,執行light級深度研究(1輪3查詢),10–20分鐘內遍歷個人庫和公網,自動抽出agent loop、context compaction等核心概念和比較。場景二:直接輸入三個GitHub倉庫(OpenCode、Pydantic Agent Framework、Hermes),系統克隆並分析代碼架構,生成各倉庫層次的理解筆記和跨倉庫架構對比。場景三最簡單——只需三個URL連結,無需預先設置任何工具。完成後都能在Obsidian中視覺化為知識圖。
目前系統仍在完善中。待辦項包括更多連接器(Google Drive、Slack等)、更好的來源信任度判斷、進階記憶壓縮。但核心已經成熟——它示範了如何用簡單的檔案系統架構解決複雜的長期記憶和知識復用問題。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


