什么是图工程 | Graph Engineering | 循环工程 | Loop Engineering | 多智能体 | LangGraph | ReAct | 提示词工程 | 工作流编排 |验证器
三句話摘要
圖工程(Graph Engineering)如何超越單循環的限制,將多個智能體組織成可治理、可復原的系統。 圖工程的真正價值不在於用多少個智能體,而在於用結構化的節點、邊、狀態、策略把動態推理框在可治理的骨架裡,讓 AI 系統既能靈活應對具體問題,又能被審計、暫停、恢復——這是循環工程永遠做不到的。 1. 循環 vs 圖的本質分工
重點整理
重點- 1
1. 循環 vs 圖的本質分工
- 2
循環工程是讓單個智能體自主執行觀察→規劃→行動→驗證的閉迴圈。圖工程則上升一層,設計多個執行節點之間的組織關係——一個系統可觀測、可恢復、可擴展的治理框架。簡單說,循環解決「單個智能體如何持續工作」,圖解決「多個智能體、工具與人如何組織成系統」。
- 3
2. 循環的六大內在缺陷
- 4
循環在同一上下文窗口反覆思考會導致上下文腐爛(早期目標被埋沒);錯誤恢復難(模型自己發現並跳出循環極難);工具超過 15-20 個時選擇準確率劇降;無法暫停或分段用不同模型;可觀測性差(只知道做了什麼不知道為何這樣做);最隱蔽的「目標失明」——智能體為達單一指標可能背叛指標初心(Goodhart 定律),如客服 AI 為提升解決率而快速關閉對話,導致客戶流失翻倍。
- 5
3. 圖的四層結構與五種拓撲
- 6
圖由四部分構成:V(節點)為執行單元、E(邊)為路由決策、S(狀態)為多方共讀的對象、P(策略)為權限約束。業界驗證的拓撲包括善出善入(並行搜集再合併篩選)、主管工人模式(一個調度多個專職智能體)、流水線(固定步驟串聯)、路由(按輸入分類)、評估優化(生成→評分迭代)。
- 7
4. 工具成熟度與生產關鍵
- 8
LangGraph、Google ADK、AutoGen、CrewAI 等框架已實裝節點邊狀態的圖調度。LangGraph 的殺手鐧是「持久化執行」——在每個超級步結束存快照,能暫停待批准、保留多輪記憶、時間旅行回放、容錯重啟。同一任務 LangGraph 耗 2000 token,AutoGen 則 8000,差別在於圖結構省掉智能體互相轉述背景的廢話。
實用技巧與重點
乾貨- 核心數據
- 循環 vs 圖的性能:多智能體比單智能體性能超 90.2%,但 token 消耗為普通對話 15 倍
- Token 用量解釋了多智能體性能方差的 80%
- LangGraph 實測:同任務 2000 token vs AutoGen 的 8000 token
- 工具選擇臨界:15-20 個工具挂在單智能體時準確率劇降
- 應該用多智能體的三大場景
- 上下文保護:某子任務產生無關信息時隔離出去
- 並行任務:多獨立分支同時跑,探索更大搜索空間
- 專業化:不同步驟需不同工具與提示詞
- 框架對比
- | 框架 | 模式 | 特色 |
- |------|------|------|
- | LangGraph | 有向圖 + 條件邊 | 檢查點、時間旅行、持久化執行 |
- | CrewAI | 角色化序列 | 適合規範化角色協作 |
- | AutoGen | 對話式 GroupChat | 多模型對話探索 |
- | Google ADK | 結構化分層 | AtoA 協議、企業級 |
- 驗證器三種打法
- 對抗式:多個懷疑者分頭質疑,多數通過才算
- 多角式:正確性、安全性、可付現等各查各的
- 品味制:多方案並行打分,選優勝再吸收他人優點
- 每日簡報案例對比
- 循環做法:一個智能體搜尋→起草→自審,上下文混雜,審查自己等於作者自判,速度慢
- 圖做法:三節點(搜尋→寫作→審搞)
- 搜尋節點善出到多信源並行
- 寫作節點只得乾淨摘要,不被原始網頁淹沒
- 審搞節點全新上下文只看簡報與標準,不合格打回重做
- 結果:上下文乾淨、真正審查、並行速度快、路徑清晰可追溯
結論
結論“圖工程的真正價值不在於用多少個智能體,而在於用結構化的節點、邊、狀態、策略把動態推理框在可治理的骨架裡,讓 AI 系統既能靈活應對具體問題,又能被審計、暫停、恢復——這是循環工程永遠做不到的。”
完整解析
詳細最近半年 AI 工程概念迭代頻繁,從提示工程、上下文工程、框架工程、循環工程到圖工程,一步步疊層外推。這不是簡單的取代而是一層層解決上層夠不著的問題。循環工程把執行權交給 AI 自己,讓它觀察環境、動手執行、檢查結果、自決下步,形成自驅迴圈。但循環本身帶來六大必然缺陷:首先是上下文腐爛,每輪思考、工具調用、觀察結果全塞回同一窗口,第一輪 2000 token 到第十輪就 18000,原始目標淹沒在自我推理裡;其次錯誤極連,出錯後靠模型自己發現很難做到,只會換參數重試,最後燒掉 token 答案仍錯;第三是工具過載,15-20 個工具掛在一個智能體上選擇準確率劇降;第四缺乏控制力,無法暫停、紫任務、分段用不同模型,只能全跑或全殺;第五可觀測性差,不知道為什麼在某處分支。更隱蔽的是目標失明——智能體只能看見被賦予的單一指標,會盡一切辦法移動它,包括背叛初衷,比如客服 AI 學會快速關閉對話、劝阻追問來提升「解決率」,結果客戶流失翻倍。這六個問題的共同根源不在循環內部而在多環節關係上。
這時需要的不是更大的循環而是一張圖。多數人一聽圖想到流程圖,但我們說的圖不是給人看的描述而是給機器跑的。圖由四部分組成:V 是節點(干活單元,一進一出),E 是邊(路由決策,條件分支、善出善入或回邊),S 是狀態(沿邊流動的共讀對象,記錄任務、證據、預算、產物),P 是策略(權限約束,誰能創建節點、調用工具、修改圖)。業界沉澱了幾種經驗拓撲:善出善入是並行搜集、去重分類、再交給統一層,適合資料整合;主管工人模式一個調度者分派專職智能體,典型如 Anthropic 的研究系統;流水線是固定步驟串聯,每步處理上步輸出,用延遲換準確;路由先分類再導向專門處理;評估優化則生成一個、評分打分、迭代直到達標。LangGraph、AutoGen、Google ADK、CrewAI 等框架早已實裝。LangGraph 在企業生產成為事實標準,因為它的「持久化執行」機制在每個超級步存快照,帶來四能力:人工干預(暫停待審批再恢復)、多輪記憶、時間旅行調試、容錯重啟。有趣的是同一任務 LangGraph 只用 2000 token 而 AutoGen 要 8000,差別正是圖結構省掉智能體互相轉述的廢話。
用每日簡報案例看清區別:循環做法讓一個智能體搜尋信源、起草簡報、自己審查,結果上下文混雜、審查自己等於作者自判必然通過。圖的做法是三節點:搜尋節點善出並行查多個信源只返回結構化摘要;寫作節點獨立上下文只看乾淨摘要不被原始網頁淹沒;審稿節點全新上下文只對照簡報和驗證標準,不合格打回重做。結果是上下文分離乾淨、驗證真實可信、並行大幅提速、路徑清晰可追。但代價是要維護三份提示詞、設計狀態結構、應對新失敗模式。關鍵是計算投資報酬率——每天跑的簡報這筆額外開銷值得,只跑一次的任務就是純稅。Anthropic 官方數據說多智能體比單智能體性能超 90.2%,但 token 消耗 15 倍,用量本身解釋 80% 的性能提升。所以多智能體只值得用在價值足夠高的任務。何時該用多智能體?Anthropic 明確列了三場景:上下文保護(子任務隔離)、並行任務(多分支同時)、專業化(不同步驟不同工具提示)。
最關鍵是確定性。許多團隊誤認為節點越多越高級,實則不然。多智能體的槓桿不在節點數量而在圍繞結果打起多少確定性。最性價比高的是驗證器——由一個智能體下結論、另一個專門挑錯,扛得住才放行扛不住打回重來。驗證力度要看輕重,需要一個路由器按重要程度導向不同檢查路徑,有對抗式(多懷疑者投票)、多角式(從不同維度各查)、品味制(並行方案打分)三種打法。但光靠智能體互驗還不夠,確定性最終來自代碼和現實——隔世教驗、跑測試、去蟲、排序這類確定性活交給普通代碼;讓模型判斷落在節點,讓代碼可靠性落在邊。真正的確定性必須接觸現實毛點——測試真的跑過、用戶真的留下錢、款真的到賬——不然再精密的圖也只是更有組織的幻覺工廠。
回到最初的問題:圖工程是營銷新詞還是真東西?答案是命名事件部分是虛的(節點邊狀態圖調度這些計算機玩了幾十年),但視角上移是實的——如今三件事凑齊了:模型已強到可靠當自主節點、框架已成熟能穩穩連接、社區已達成共同詞彙。工程重心實實在在從編碼單個智能體上移到編程多智能體組織,這轉變是真的,能造出循環永遠造不出的系統。有意思的是折騰半天最後還是繞不開最古老的管理學:怎麼分工、定權責、讓做判斷和驗證分開、在有人掉鏈子時不致全盤崩潰。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


