KeyFrame內部研究專用

AI使用范式转型:从Chat转向Agent

白白说大模型·8月4日週二·8 min中文

三句話摘要

從 Chat 到 Agent:通過本地化部署實現 5-10 倍生產力跨越 本地化 Agent 的核心就是讓 AI 從無狀態聊天轉向基於本地上下文的深度協同,通過分層記憶和探索→規劃→執行循環,將生產力從 20% 跳躍到 5-10 倍。 Chat 的致命局限是隔離。網頁版 AI 與用戶的本地環境完全隔離,無法記住用戶身份、最近工作或長期計畫,導致每次對話都要重複提供背景信息。Agent 通過嵌入本地環境,直接接入工作軟件和文件,使 AI 成為真正的協同者而非局外人。

重點整理

重點
  • 1

    Chat 的致命局限是隔離。網頁版 AI 與用戶的本地環境完全隔離,無法記住用戶身份、最近工作或長期計畫,導致每次對話都要重複提供背景信息。Agent 通過嵌入本地環境,直接接入工作軟件和文件,使 AI 成為真正的協同者而非局外人。

  • 2

    分層記憶機制是 Agent 的核心架構。第一層核心指令層常駐,存放學習計畫和階段目標;第二層動態上下文按需加載,包含當前工作內容;第三層歸檔檢索在主動查詢時啟動,存放歷史記錄。這樣既避免資源浪費又保證精準響應。

  • 3

    探索→規劃→執行循環保證輸出品質。Agent 不會立刻回答,而是先讀取本地數據進行探索,再比對當前進度與長期目標進行規劃,最後才針對性地執行。這種分離模式杜絕了 AI 下筆亂說的問題。

  • 4

    低門檻實現方案讓普通人也能部署。用 Obsidian 管理本地數據、Codex/Tree 做環境感知和權限控制、Deepseek V4 Pro API 作推理引擎,三個工具組合即成完整架構,對普通人來說毫無門檻。

實用技巧與重點

乾貨
  • 關鍵工具
  • Obsidian(本地文件管理)
  • Codex 或 Tree(環境感知與權限控制)
  • Deepseek V4 Pro API(推理引擎)
  • 文件夾結構
  • 四個核心模塊:計畫、筆記、目標、復盤記錄
  • 工作流三步
  • 建立結構化文件夾
  • 每次啟動前動態預讀工作區目錄和核心說明文件
  • 給出具體指令交互(如「我現在學到哪兒」「哪裡沒搞懂」「今天最該做什麼」)
  • Agent 三層記憶
  • 層級一:核心指令層(常駐)
  • 層級二:動態上下文(按需加載)
  • 層級三:歸檔檢索(主動查詢觸發)
  • 工作循環
  • 探索(讀取本地數據)→ 規劃(生成方案)→ 執行(針對性回答)
  • 效率差異
  • Chat 模式:約 20% 提升
  • Agent 本地協同:5-10 倍提升
  • 進階路線三層級
  • 基礎認知層:理解大模型原理、學會提供高質量上下文
  • 知識增強層:搭建本地知識庫、優化 AI 檢索機制
  • 架構開發層:自行開發專屬 Agent、介入複雜自動化工作流

結論

結論

本地化 Agent 的核心就是讓 AI 從無狀態聊天轉向基於本地上下文的深度協同,通過分層記憶和探索→規劃→執行循環,將生產力從 20% 跳躍到 5-10 倍。

完整解析

詳細

當前大多數人使用 AI 停留在網頁版 Chat 階段。每次打開聊天框,AI 都像第一次認識使用者一樣,無法記住身份、工作內容或長期計畫。這是因為網頁版 AI 與本地環境完全隔離——學習計畫、項目代碼、筆記文檔等全在用戶電腦裡。結果導致三個問題:沒有記憶、上下文斷裂、目標脫節。用戶每次都要寫冗長背景、複製粘貼本地資料,生產力僅提升 20%。

要打破這種局面,需要從 Chat 轉向 Agent 模式。Agent 的本質是將 AI 嵌入本地環境,讓它直接接入工作軟件和文件。一旦 AI 能讀取本地代碼、計畫和文檔,情況完全改變:無需寫繁琐提示詞,背景信息已在本地文件中;AI 獲得深度感知,知道用戶哪些筆記是重點;AI 掌握全局視野,記得上週進度和下週安排。此時 AI 才能從聊天局外人變成高效協同的局內人。

Agent 的核心是分層記憶機制。它不是把所有文件塞給 AI,而是分成三層:核心指令層常駐存放學習計畫和階段目標,無論何時都被牢記;動態上下文按需加載,包括當前寫的章節、今天改的代碼、本週筆記;歸檔檢索在用戶主動提問時才搜索歷史復盤和舊記錄。這樣既節省資源又精準響應。Agent 工作遵循嚴謹循環:探索(自動讀取本地筆記、目標、復盤)→ 規劃(比對進度生成方案)→ 執行(針對性回答或生成文件)。這種模式最大程度避免 AI 胡說八道。

實現這套系統門檻很低。用戶只需三個工具:Obsidian 管理本地 Markdown 文件夾,Codex 或 Tree 做環境感知和權限控制,Deepseek V4 Pro API 作推理引擎。具體搭建分三步:第一步在 Obsidian 建立結構化工作區,至少包含計畫、筆記、目標、復盤四個模塊,文件夾越清晰 AI 讀取越高效;第二步是動態預讀,每次啟動 Agent 前先讓它完整掃描工作區目錄和核心說明文件,相當於把工作環境和規則載入 AI 短期記憶;第三步是精準指令交互,用戶不再問籠統的「幫我整理」,而是給出具體指令如「我現在學到哪兒、哪裡沒搞懂、今天最該做什麼」。Agent 接收指令時自動觸發本地讀取,快速生成明確執行項。用戶可把 AI 當成項目經理,指令越具體,本地檢索就越精準。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。