KeyFrame內部研究專用

Vibe Coding架构解析:大模型时代的意图识别编程与工程化约束!

白白说大模型·7月14日週二·20 min中文

三句話摘要

AI 驅動編程的新範式:通過認知層、執行層、編排層的三位一體架構,實現穩定可靠的自動化代碼生成。 掌握 Web Coding 的三位一體底層架構(讀寫隔離、約束注入、記憶收斂),不管技術如何迭代,你都能穩定生產高質量的商業級代碼,從扣語法細節的泥瓦匠升級為掌控全局的總指揮。 Web Coding 本質是開發習慣的轉變。傳統模式中開發者既要設計邏輯又要處理語法細節,而新範式下開發者只負責表達意圖和最後驗收,所有實現細節交由 AI 執行架構完成。

重點整理

重點
  • 1

    Web Coding 本質是開發習慣的轉變。傳統模式中開發者既要設計邏輯又要處理語法細節,而新範式下開發者只負責表達意圖和最後驗收,所有實現細節交由 AI 執行架構完成。

  • 2

    大模型與本地 Agent 通過方法調用實現協作。雲端大模型因沙盒隔離無法直接改寫本地文件,通過 Tool Calling 把指令翻譯成結構化調用,本地 Agent 接收後執行文件讀寫和測試,再把結果回傳給大模型形成閉環。

  • 3

    編排層通過 SDD 和 TDD 兩種工作流規範 AI 行為。SDD(軟體設計文檔)驅動流程強制 AI 先澄清需求再寫代碼;TDD(測試驅動開發)流程讓測試用例成為 AI 的絕對約束,防止胡亂修改。

  • 4

    分層記憶機制防止上下文退化。常駐記憶(200 行以內)記錄核心規範,懶載記憶按需加載具體資料,檢索記憶保存完整歷史,確保大模型不會遺忘項目約束。

實用技巧與重點

乾貨
  • 三個發展階段:
  • 第一階段(複製粘貼時代):聊天框問答 → 手動複製粘貼代碼
  • 第二階段(智能體時代):本地工具(Cursor、Claude Code)可讀寫文件、自動測試
  • 第三階段(工作流時代):引入框架和約束,規範 AI 行為
  • 模型分級:
  • 代碼專精模型:Claude 3.5 Sonnet(首選,邏輯推理和代碼能力最強)
  • 通用模型:GPT-4O、Google Gemini(全場景覆蓋,適合多模態交互)
  • 高效率模型:DeepSeek、Qwen(性價比高,適合簡單重複任務)
  • 主流工作流框架:
  • OpenSpace:典型 SDD 驅動,包含 Explorer → Propose → Implemented 三個狀態機
  • SuperPowers:典型 TDD 驅動,以測試用例為絕對約束
  • EPA 模式(讀寫隔離):
  • Explore 階段:只讀(檢索文件、全文搜索)
  • Plan 階段:只讀(制定方案、寫設計文檔)
  • Execute 階段:可寫(修改文件、運行測試)
  • 分層記憶架構:
  • 常駐記憶:memory.md 文件,不超過 200 行,記錄核心規範
  • 懶載記憶:用戶手冊、架構文檔等,按需加載
  • 檢索記憶:完整對話歷史,通過搜索引擎定向檢索

結論

結論

掌握 Web Coding 的三位一體底層架構(讀寫隔離、約束注入、記憶收斂),不管技術如何迭代,你都能穩定生產高質量的商業級代碼,從扣語法細節的泥瓦匠升級為掌控全局的總指揮。

完整解析

詳細

Web Coding 這個概念由特斯拉前 AI 總監 Andrej Karpathy 提出,本質上是一種全新的開發習慣。傳統開發模式中,開發者需要同時承擔「設計師」和「泥瓦匠」兩個角色——既要想邏輯,又要扣語法細節、API 調用。而在 Web Coding 模式下,這個分工被徹底改變:開發者只需扮演「總指揮」或「產品經理」的角色,用自然語言表達意圖,剩下的所有體力活都交給 AI 執行架構完成。

Web Coding 的發展經歷了三個明確的階段。第一階段是「複製粘貼時代」,大約一兩年前,開發者在聊天框中問 ChatGPT 或 Claude,它吐出代碼後需要手動複製粘貼到本地編輯器,如果出錯還要複製錯誤信息回傳。此時 AI 與本地環境完全隔離。第二階段進入「智能體時代」,Cursor、Claude Code 等工具可以直接運行在本地電腦上,能讀寫項目文件、自動運行和修錯,減少了手動複製粘貼的頻率。但 AI 仍然缺乏大局觀,經常在細節上單兵作戰。第三階段才是真正的「工作流時代」,這就是 Web Coding 的核心——引入框架和約束,通過標準化的工作流規範 AI 行為,確保在多輪修改中代碼不會損壞、不會遺漏需求。

完整的 Web Coding 架構由三個層級組成,可以類比為一個團隊的分工。最底層是「認知層」,由各類大模型組成——Claude 3.5 Sonnet 這種代碼專精模型、GPT-4O 這種全能通用模型,以及 DeepSeek、Qwen 這種高效率本地模型。他們負責提供核心的推理和代碼生成能力。中間層是「執行層」,由本地運行的 Agent 工具(如 Cursor、Claude Code)組成,他們接收大腦的指令,真正操作本地計算機——讀取項目結構、寫入文件、運行測試。最關鍵的是第三層「編排層」,由工作流框架(如 OpenSpace、SuperPowers)提供,他們定義開發流程和行為約束,規定 AI 必須先幹什麼再幹什麼,像項目經理一樣維護工程秩序。

大模型在雲端服務器上,代碼在本地硬盤里,這種物理隔離帶來了協作難題。大模型本質是運行在沙盒中的文本生成引擎,它看不見也摸不著本地電腦。解決方案是通過「方法調用」(Tool Calling)技術實現橋梁。當大模型想修改本地文件時,不會直接操作,而是通過 API 把指令發送給本地 Agent。本地 Agent 因為直接運行在電腦上,擁有文件系統的全線操作權限,會執行具體的 I/O 操作。如果代碼運行出錯,Agent 會把錯誤信息回傳給大模型,大模型再做下一輪推理。這就像雲端的大腦通過無線電遙控本地的機器人幹活,物理隔離因此被打破。

但放任 AI 自由發揮會導致三個致命痛點。第一是「修小錯引發大患」,AI 為修復一個小 bug 經常大範圍改代碼,反而引入更多隱蔽缺陷。第二是「需求偏差」,自然語言溝通容易模糊,AI 經常根據自己的腦補做錯誤假設。第三是「上下文退化」,多輪對話後大模型因注意力限制而遺忘最初的核心規範。為了對付這些問題,編排層引入了兩種主流工作流:一是 SDD(軟體設計文檔)驅動,代表框架是 OpenSpace,核心理念是「規範先行,先討論後定稿再編碼」,通過狀態機控制(Explorer → Propose → Implemented)把需求澄清固定下來。二是 TDD(測試驅動開發)驅動,代表框架是 SuperPowers,核心理念是「測試先行」,AI 必須先寫測試,業務代碼只能寫剛好通過測試的最小實現,然後在測試綠燈後才能重構優化。

此外,編排層還採用了「EPA 模式」(讀寫隔離):Explore 階段 AI 只讀,去檢索文件結構;Plan 階段仍然只讀,制定方案和寫設計文檔;Execute 階段才給予寫權限。同時使用分層記憶機制防止上下文污染:常駐記憶(memory.md,不超過 200 行)記錄核心規範和必須牢記的約束;懶載記憶存放用戶手冊、架構文檔等,按需加載;檢索記憶保存完整對話歷史,只在需要查證歷史決策時通過搜索引擎定向檢索。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。