KeyFrame內部研究專用

Loop Engineering 解析,大神都不寫 prompt 了?

Gary Chen·7月1日週三·13 min中文

三句話摘要

Loop Engineering:設計 AI 自主迴圈,讓 AI 自行執行、驗證、修正,直到達成目標。 Loop Engineering 的精髓是把模糊意圖翻譯成 AI 可執行、可驗收、可停止的明確條件,但多數人無需追求,應先衡量任務的重複性、標準清晰度和成本,再決定是否值得投入。 工作模式轉變 — 過去是人類逐輪審核(你提示→看結果→反饋→它改→你再看),現在是用戶一次性設計規則與驗收標準,讓 AI 自主在執行→觀察→修正→驗證的迴圈中運作,首次交付成果從 60 分升至 85 分。

重點整理

重點
  • 1

    工作模式轉變 — 過去是人類逐輪審核(你提示→看結果→反饋→它改→你再看),現在是用戶一次性設計規則與驗收標準,讓 AI 自主在執行→觀察→修正→驗證的迴圈中運作,首次交付成果從 60 分升至 85 分。

  • 2

    與其他概念的區別 — Prompt Engineering 講清通、Context Engineering 講對時機給資訊、Harness Engineering 講環境邊界與工具;Loop Engineering 專注把人的審核邏輯與反饋標準化,讓 AI 自行執行反覆驗證。

  • 3

    兩個決策核心 — Trigger 決定迴圈何時開始(事件/排程/手動),Verifiable Goal 決定何時停止。後者最難:編碼任務可用測試通過、Lint 無誤等客觀標準;改文章、優化效能需設計 Rubric(按維度評分 1-5 分)或 Yes/No Checklist 來轉化主觀判斷。

  • 4

    三大失控風險與規則 — 不知何時停止→設硬性停止條件(最多 N 輪、最多 X token);改錯地方→定義邊界(不能刪測試、不能改 API);驗收失效→分離產出與驗收 Agent,避免 AI 自我評分。

實用技巧與重點

乾貨
  • Rubric 評分法:選定維度(風格、人設、語法),每級清晰定義
  • 5 分:完全符合人設,用詞語氣一致
  • 3 分:有點像但偶爾出戲
  • 1 分:根本沒有風格
  • Yes/No Checklist 法:開頭有沒有抓住重點、有沒有錯字、格式對不對(判斷比評分穩定)
  • 判斷任務適合度的三要素:①重複性(一次性任務不值得);②標準清晰度(最關鍵);③Token 成本(多輪迭代花費)
  • 安全設定:Hard Stop(最多 N 輪 / X 小時 / Y token)、邊界定義(哪些檔案/API 不能碰)、驗收分離(分開產出和檢查的 Agent)
  • 入門級任務:每天整理固定資料夾、針對測試項目修復、針對文章跑品質檢查 Checklist

結論

結論

Loop Engineering 的精髓是把模糊意圖翻譯成 AI 可執行、可驗收、可停止的明確條件,但多數人無需追求,應先衡量任務的重複性、標準清晰度和成本,再決定是否值得投入。

完整解析

詳細

Loop Engineering 是近期 AI 社群討論的焦點。OpenCloud 創辦人 Peter Steinberger、Claude Code 負責人 Boris Cheney,乃至 Google 工程主管 Addy Osmani 都在推介一套新的工作範式——告別逐輪人工審核,改為人類一次性設計規則與驗證標準,然後放手讓 AI 在迴圈中自主執行。過去的協作模式是「你提示→AI 執行→你看結果→你反饋→它修改→你再看」,每一輪都需人類坐在螢幕前決策。Loop Engineering 把工作重心上移:用戶在開始前明確定義目標、可用工具、驗證方式和停止條件,AI 自動經歷執行、讀錯誤、修正、驗證的完整迴圈,無需人類逐輪介入。舉例而言,與其你逐一審看十張 YouTube 封面,不如告訴 AI「用觀眾一眼看懂、勾起好奇心、視覺對比、符合內容四個標準逐張打分,沒過關的改版重打,最後給我分數最高的三張」。結果是 AI 交付的成品已從初始的 60 分磨練到了 85 分,大幅削減人類調整成本。

Lock Engineering 的兩大支柱是 Trigger 和 Verifiable Goal。Trigger 控制迴圈何時啟動——可以是 GitHub 收到 PR 的事件、每天早上跑一次的排程,也可以是你手動決定。Verifiable Goal 則管制何時停止,難點在於把抽象概念轉化為機器可檢查的標準。編碼工作相對簡單:所有單元測試通過、TypeScript 無誤、Lint 無違規,AI 能直接判斷。但改文章、優化效能、設計界面這類帶主觀色彩的任務就需要精心設計驗收標準。Rubric 方法是列舉維度(風格、人設、語法、用詞),每分數都配清晰定義——5 分代表完全符合人設,3 分代表有點像但偶爾出戲,1 分代表根本沒風格。Checklist 方法則逐項提出 yes/no 問題:開頭有沒有抓住重點、有沒有錯字、專有名詞用對了嗎,判斷時更穩定、更容易過關。無論用哪一種,最終都要凝聚成明確的完成條件,例如三個維度都達 4 分以上,或 Checklist 全部通過。

並非所有任務都該設計成 Loop。評估的標準有三個:一是重複性——一次性任務投不起;二是完成標準是否清晰——這是最大障礙,明確標準能精準引導 AI,模糊標準導致 AI 漫無目的;三是成本承受度——多輪迭代、多個驗收 Agent,token 開銷會急速上升。此外還要防範三大失控陷阱:其一,AI 不知何時停止,導致 token 成本爆炸,對策是設硬性停止條件(最多 N 輪、最多花 Y token、連續 N 輪無進展就停);其二,AI 改錯地方,例如說優化效能它卻重構架構,對策是明確邊界(不能刪測試、不能改公開 API、不能動資料庫 Schema、不能碰核心檔案);其三,驗收機制失效,因為 AI 自評容易自欺欺人,對策是分離產出與驗收(一個 Agent 負責產出,另一個負責評審,或在關鍵節點保留人工審核)。

作者坦言,比起執著於無限 Loop,他更青睞 Human Loop。大多數人並不需要 AI 二十四小時不睡地跑一整天,而是希望 AI 交出的成果已打磨得夠好,省掉大量後續調整。成本是決定因素——除非你像 OpenAI、Anthropic 工程師那樣擁有幾近無限的 token 預算,否則人工審核的迴圈往往更經濟且更高效。若想親身體驗 Loop Engineering,作者建議從小任務切入——資料整理、測試套件修復、文章品質檢查這類目標精準、範圍有限的工作,既不會失控也不會巨額虧損,還能逐步摸透如何定義目標、設計驗收、控制權限、把握停止時機。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。