KeyFrame內部研究專用

什么是Loop Engineering?

白白说大模型·7月13日週一·19 min中文

三句話摘要

AI 工程已從提示詞優化進化到循環工程,通過系統設計而非人工介入來驅動 AI 的自主迭代與自動修正。 AI 工程師的職業進化不是被淘汰,而是從手工磚頭匠升級成設計自動盖樓機的系統架構師——但最終決定大樓該如何建造的,永遠還是人類自己。 從提示詞工程到循環工程的認知轉變

重點整理

重點
  • 1

    從提示詞工程到循環工程的認知轉變

  • 2

    提示詞寫得再好也是一對一的問答,成為了人工的瓶頸。真正的進展是建立類似手機導航的系統——用戶只需設定目標,系統自動規劃路線、遇到錯誤自動重新計算,人類完全解放。這反映了一個根本的角色轉換:從手工作業者變成系統架構師。

  • 3

    內循環與外循環的職責分離

  • 4

    內循環是 Agent 的自主決策過程(感知→推理→執行→觀察),類比專業司機自己判斷何時踩刹車;外循環是系統的調度層,負責分配任務、驗證結果、觸發下一輪迭代。開發者要設計的是外循環,而非手把手指導 Agent。

  • 5

    循環系統的五節點運作機制

  • 6

    意圖(定義成功標準)→ 搜索上下文 → 行動 → 觀察結果 → 調整計畫,形成持續自我修正的閉環。失敗的錯誤信息並非壞事,反而是最高品質的上下文,驅動下一輪更精準的迭代。

  • 7

    工程落地的核心風險管控

  • 8

    實施時最易踩坑:理解債(代碼改得太快看不完)、認知投降(過度信任系統喪失思考)、四類故障模式(空轉、測試鑽漏、上下文飄移、權限越界),必須建立最小權限原則和人工驗收機制。

實用技巧與重點

乾貨
  • AI 工程四個階段
  • 第一階段:提示詞工程(Prompt Engineering)
  • 第二階段:上下文工程(Context Engineering / RAG)
  • 第三階段:工具工程(Harness Engineering / Tool Use)
  • 第四階段:循環工程(Loop Engineering)
  • 編程工具三代演進
  • 第一代:Co-pilot(高級輸入法,自動補全)
  • 第二代:ChatGPT / Claude / 豆包(對話式一問一答)
  • 第三代:Claude Code / AI IDE(自主規劃→修改→測試→迭代)
  • 循環系統五核心節點
  • Intent(意圖)— 定義成功標準
  • Search Context(搜索上下文)— 收集相關代碼、文檔、規範
  • Action(行動)— 修改文件、調用工具
  • Observe(觀察)— 抓取測試結果、錯誤信息
  • Adjust(調整)— 根據觀察更新計畫
  • 循環系統六大核心要素
  • 自動化觸發(Pre-hook / Post-hook 生命週期管理)
  • 隔離演練(Worktree 獨立分支並行測試)
  • 安全邊界(風險分析:安全指令直接放行、高風險拦截詢問、危險操作無條件拦截)
  • 工具連接(本地工具 + MCP 協議 + 遠程 API)
  • 角色分離(ExploreAgent 只讀 vs CodeAgent 讀寫)
  • 記憶分層(核心狀態必載 → 按需加載文檔 → 全文搜索日誌)
  • 命令風險分級示例
  • 安全指令:npm test、單元測試 → 直接放行
  • 高風險命令:git push --force → 拦截詢問
  • 危險操作:rm -rf、刪除命令 → 無條件拦截
  • 四類常見故障模式
  • 空轉(無限改代碼無法通過測試)→ 縮小目標範圍,提供具體驗證指令
  • 過度和測試(測試通過但業務不可用)→ 增加端到端真實場景測試、人工驗收
  • 上下文飄移(基於過期假定寫代碼)→ 強制系統在觀察後清空並重新收集上下文
  • 不安全的自主(權限越界、破壞性錯誤)→ 實施最小權限原則、明確停止規則
  • 四條黃金法則
  • 從窄任務開始 — 明確邊界的小任務,不要泛化的大目標
  • 偏耗小且可逆 — 最小連貫修改,驗證後再擴展
  • 提供確定的驗證信號 — 在指令中硬編碼驗證命令
  • 尊重現有的代碼模式 — 先檢查組件和命名規範,優先複用代碼

結論

結論

AI 工程師的職業進化不是被淘汰,而是從手工磚頭匠升級成設計自動盖樓機的系統架構師——但最終決定大樓該如何建造的,永遠還是人類自己。

完整解析

詳細

AI 工程的發展走過了四個清晰的階段。最初大家都在琢磨怎麼優化提示詞,期待一個完美的指令就能換來完美的答案。但實踐中發現,人類阅讀和複製粘貼的速度成了最大瓶頸:AI 給代碼、人手動運行、報錯了再把錯誤粘回去問 AI,整個流程被人工操作卡死。這就像沒有導航時開車——每開幾公里就要停下來翻紙質地圖。後來進入上下文工程階段,開始通過 RAG 塞更多背景信息;再後來是工具工程,給 AI 配備各種 API 和命令行工具。但這三個階段都有一個共同點:人類始終在後面推著 AI 做事。

真正的突破是循環工程的出現。這就像有了手機導航,用戶只需輸入目的地,系統自己規劃路線,開錯方向自動重算,整個過程完全自動。對應到代碼開發上,就是我們設計一套完整的自動循環系統:定義意圖(什麼才算成功)→ 系統自動搜集上下文 → AI 執行修改 → 系統自動跑測試觀察結果 → 根據錯誤信息自動調整計畫 → 重新開始下一輪。核心是系統在驅動整個過程,而不是人類。

這種方式要求我們重新理解 AI 工程的職責。傳統的模式是「內循環」和「外循環」各司其職。內循環是 Agent 自己的決策過程——就像專業司機看到紅燈自己決定踩刹車,你根本不用在副駕座喊「踩刹車」。外循環才是我們要設計的——像網約車平台的調度系統一樣,負責發現任務、分配給合適的 Agent、驗證工作成果、觸發下一輪。開發者的角色從「手工作業者」升級成了「系統架構師」。

實際落地時,系統需要六大核心要素才能穩定運轉。首先是自動化觸發,透過 pre-hook 和 post-hook 生命週期管理,消除人工操作。其次是隔離演練,用 worktree 為不同的 Agent 建立獨立的工作分支,互不干擾。安全邊界尤其重要——對命令風險分級,安全指令直接放行、高風險操作拦截詢問、危險操作無條件拦截。工具連接方面,從本地文件讀寫逐步擴展到透過 MCP 協議連接遠程服務。角色分離讓 ExploreAgent(只讀)和 CodeAgent(讀寫)各司其職。記憶分層分三層:核心狀態必載、具體文檔按需加載、歷史日誌仅供搜索。一個核心原則是「倉庫記得即是模型不記得」——只要代碼倉庫裡有清晰文檔和完整測試,系統隨時能為 AI 重新加載最新最精準的上下文。

然而實施這套系統時,工程師最容易踩的坑是「理解債」和「認知投降」。理解債就是代碼改得太快了,你還沒看完就有一堆綠色測試通過,直接點了合併——這樣你對系統的掌控力會越來越弱。認知投降更危險,像開啟自動駕駛後就完全放棄了方向盤,但 AI 不懂長期架構風險,最終的代碼合併和架構驗證還是人類的責任。常見的故障有四種:空轉(無限改代碼無法通過)、過度和測試(測試通過但業務不能用)、上下文飄移(基於過期信息寫代碼)、不安全的自主(權限越界)。應對的黃金法則是:從窄而具體的任務開始、每次最小可逆的修改、提供確定的驗證信號、尊重現有的代碼模式。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。