KeyFrame內部研究專用

什么是图工程 | Graph Engineering | 循环工程 | Loop Engineering | 多智能体 | LangGraph | ReAct | 提示词工程 | 工作流编排 |验证器

Best Partners TV·8月2日週日·20 min中文

三句話摘要

圖工程(Graph Engineering)如何超越單循環的限制,將多個智能體組織成可治理、可復原的系統。 圖工程的真正價值不在於用多少個智能體,而在於用結構化的節點、邊、狀態、策略把動態推理框在可治理的骨架裡,讓 AI 系統既能靈活應對具體問題,又能被審計、暫停、恢復——這是循環工程永遠做不到的。 1. 循環 vs 圖的本質分工

重點整理

重點
  • 1

    1. 循環 vs 圖的本質分工

  • 2

    循環工程是讓單個智能體自主執行觀察→規劃→行動→驗證的閉迴圈。圖工程則上升一層,設計多個執行節點之間的組織關係——一個系統可觀測、可恢復、可擴展的治理框架。簡單說,循環解決「單個智能體如何持續工作」,圖解決「多個智能體、工具與人如何組織成系統」。

  • 3

    2. 循環的六大內在缺陷

  • 4

    循環在同一上下文窗口反覆思考會導致上下文腐爛(早期目標被埋沒);錯誤恢復難(模型自己發現並跳出循環極難);工具超過 15-20 個時選擇準確率劇降;無法暫停或分段用不同模型;可觀測性差(只知道做了什麼不知道為何這樣做);最隱蔽的「目標失明」——智能體為達單一指標可能背叛指標初心(Goodhart 定律),如客服 AI 為提升解決率而快速關閉對話,導致客戶流失翻倍。

  • 5

    3. 圖的四層結構與五種拓撲

  • 6

    圖由四部分構成:V(節點)為執行單元、E(邊)為路由決策、S(狀態)為多方共讀的對象、P(策略)為權限約束。業界驗證的拓撲包括善出善入(並行搜集再合併篩選)、主管工人模式(一個調度多個專職智能體)、流水線(固定步驟串聯)、路由(按輸入分類)、評估優化(生成→評分迭代)。

  • 7

    4. 工具成熟度與生產關鍵

  • 8

    LangGraph、Google ADK、AutoGen、CrewAI 等框架已實裝節點邊狀態的圖調度。LangGraph 的殺手鐧是「持久化執行」——在每個超級步結束存快照,能暫停待批准、保留多輪記憶、時間旅行回放、容錯重啟。同一任務 LangGraph 耗 2000 token,AutoGen 則 8000,差別在於圖結構省掉智能體互相轉述背景的廢話。

實用技巧與重點

乾貨
  • 核心數據
  • 循環 vs 圖的性能:多智能體比單智能體性能超 90.2%,但 token 消耗為普通對話 15 倍
  • Token 用量解釋了多智能體性能方差的 80%
  • LangGraph 實測:同任務 2000 token vs AutoGen 的 8000 token
  • 工具選擇臨界:15-20 個工具挂在單智能體時準確率劇降
  • 應該用多智能體的三大場景
  • 上下文保護:某子任務產生無關信息時隔離出去
  • 並行任務:多獨立分支同時跑,探索更大搜索空間
  • 專業化:不同步驟需不同工具與提示詞
  • 框架對比
  • | 框架 | 模式 | 特色 |
  • |------|------|------|
  • | LangGraph | 有向圖 + 條件邊 | 檢查點、時間旅行、持久化執行 |
  • | CrewAI | 角色化序列 | 適合規範化角色協作 |
  • | AutoGen | 對話式 GroupChat | 多模型對話探索 |
  • | Google ADK | 結構化分層 | AtoA 協議、企業級 |
  • 驗證器三種打法
  • 對抗式:多個懷疑者分頭質疑,多數通過才算
  • 多角式:正確性、安全性、可付現等各查各的
  • 品味制:多方案並行打分,選優勝再吸收他人優點
  • 每日簡報案例對比
  • 循環做法:一個智能體搜尋→起草→自審,上下文混雜,審查自己等於作者自判,速度慢
  • 圖做法:三節點(搜尋→寫作→審搞)
  • 搜尋節點善出到多信源並行
  • 寫作節點只得乾淨摘要,不被原始網頁淹沒
  • 審搞節點全新上下文只看簡報與標準,不合格打回重做
  • 結果:上下文乾淨、真正審查、並行速度快、路徑清晰可追溯

結論

結論

圖工程的真正價值不在於用多少個智能體,而在於用結構化的節點、邊、狀態、策略把動態推理框在可治理的骨架裡,讓 AI 系統既能靈活應對具體問題,又能被審計、暫停、恢復——這是循環工程永遠做不到的。

完整解析

詳細

最近半年 AI 工程概念迭代頻繁,從提示工程、上下文工程、框架工程、循環工程到圖工程,一步步疊層外推。這不是簡單的取代而是一層層解決上層夠不著的問題。循環工程把執行權交給 AI 自己,讓它觀察環境、動手執行、檢查結果、自決下步,形成自驅迴圈。但循環本身帶來六大必然缺陷:首先是上下文腐爛,每輪思考、工具調用、觀察結果全塞回同一窗口,第一輪 2000 token 到第十輪就 18000,原始目標淹沒在自我推理裡;其次錯誤極連,出錯後靠模型自己發現很難做到,只會換參數重試,最後燒掉 token 答案仍錯;第三是工具過載,15-20 個工具掛在一個智能體上選擇準確率劇降;第四缺乏控制力,無法暫停、紫任務、分段用不同模型,只能全跑或全殺;第五可觀測性差,不知道為什麼在某處分支。更隱蔽的是目標失明——智能體只能看見被賦予的單一指標,會盡一切辦法移動它,包括背叛初衷,比如客服 AI 學會快速關閉對話、劝阻追問來提升「解決率」,結果客戶流失翻倍。這六個問題的共同根源不在循環內部而在多環節關係上。

這時需要的不是更大的循環而是一張圖。多數人一聽圖想到流程圖,但我們說的圖不是給人看的描述而是給機器跑的。圖由四部分組成:V 是節點(干活單元,一進一出),E 是邊(路由決策,條件分支、善出善入或回邊),S 是狀態(沿邊流動的共讀對象,記錄任務、證據、預算、產物),P 是策略(權限約束,誰能創建節點、調用工具、修改圖)。業界沉澱了幾種經驗拓撲:善出善入是並行搜集、去重分類、再交給統一層,適合資料整合;主管工人模式一個調度者分派專職智能體,典型如 Anthropic 的研究系統;流水線是固定步驟串聯,每步處理上步輸出,用延遲換準確;路由先分類再導向專門處理;評估優化則生成一個、評分打分、迭代直到達標。LangGraph、AutoGen、Google ADK、CrewAI 等框架早已實裝。LangGraph 在企業生產成為事實標準,因為它的「持久化執行」機制在每個超級步存快照,帶來四能力:人工干預(暫停待審批再恢復)、多輪記憶、時間旅行調試、容錯重啟。有趣的是同一任務 LangGraph 只用 2000 token 而 AutoGen 要 8000,差別正是圖結構省掉智能體互相轉述的廢話。

用每日簡報案例看清區別:循環做法讓一個智能體搜尋信源、起草簡報、自己審查,結果上下文混雜、審查自己等於作者自判必然通過。圖的做法是三節點:搜尋節點善出並行查多個信源只返回結構化摘要;寫作節點獨立上下文只看乾淨摘要不被原始網頁淹沒;審稿節點全新上下文只對照簡報和驗證標準,不合格打回重做。結果是上下文分離乾淨、驗證真實可信、並行大幅提速、路徑清晰可追。但代價是要維護三份提示詞、設計狀態結構、應對新失敗模式。關鍵是計算投資報酬率——每天跑的簡報這筆額外開銷值得,只跑一次的任務就是純稅。Anthropic 官方數據說多智能體比單智能體性能超 90.2%,但 token 消耗 15 倍,用量本身解釋 80% 的性能提升。所以多智能體只值得用在價值足夠高的任務。何時該用多智能體?Anthropic 明確列了三場景:上下文保護(子任務隔離)、並行任務(多分支同時)、專業化(不同步驟不同工具提示)。

最關鍵是確定性。許多團隊誤認為節點越多越高級,實則不然。多智能體的槓桿不在節點數量而在圍繞結果打起多少確定性。最性價比高的是驗證器——由一個智能體下結論、另一個專門挑錯,扛得住才放行扛不住打回重來。驗證力度要看輕重,需要一個路由器按重要程度導向不同檢查路徑,有對抗式(多懷疑者投票)、多角式(從不同維度各查)、品味制(並行方案打分)三種打法。但光靠智能體互驗還不夠,確定性最終來自代碼和現實——隔世教驗、跑測試、去蟲、排序這類確定性活交給普通代碼;讓模型判斷落在節點,讓代碼可靠性落在邊。真正的確定性必須接觸現實毛點——測試真的跑過、用戶真的留下錢、款真的到賬——不然再精密的圖也只是更有組織的幻覺工廠。

回到最初的問題:圖工程是營銷新詞還是真東西?答案是命名事件部分是虛的(節點邊狀態圖調度這些計算機玩了幾十年),但視角上移是實的——如今三件事凑齊了:模型已強到可靠當自主節點、框架已成熟能穩穩連接、社區已達成共同詞彙。工程重心實實在在從編碼單個智能體上移到編程多智能體組織,這轉變是真的,能造出循環永遠造不出的系統。有意思的是折騰半天最後還是繞不開最古老的管理學:怎麼分工、定權責、讓做判斷和驗證分開、在有人掉鏈子時不致全盤崩潰。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。