The Agentic AI Engineer - Benedikt Sanftl, Mutagent
三句話摘要
Agentic AI Engineer:通過自動化循環加速 AI 代理的開發、評估、部署與優化。 --- 通過讓代理自主執行開發循環中的評估、診斷和優化工作,Agentic AI Engineer 消除了人工審查瓶頸,使 AI 代理的大規模部署和持續改進成為可能。 1. 循環的自動化解決了擴展性困境
重點整理
重點- 1
1. 循環的自動化解決了擴展性困境
- 2
傳統方式需要人工執行規格定義、構建、評估、部署、監控、診斷、優化等步驟,當代理數量增加到數百個時,人工審查變成無法突破的瓶頸。通過讓代理自主執行這些流程中的大部分工作,可以顯著提升迭代速度,在相同時間窗口內完成更多開發週期。
- 3
2. Spec 驅動開發確保長期靈活性
- 4
規格文檔是構建的藍圖,清晰定義了代理的職責、上下文需求、工具集成和邊界。因為框架演進迅速(Hermes、Deep Agents 等新框架不斷涌現),通過將規格與實現細節分離,團隊可以在一年後無痛遷移到新平台而無需重新設計。
- 5
3. Eval 驅動開發等同於代理版本的測試驅動開發
- 6
評估套件由指標、評判標準和測試數據集組成,是判斷代理是否「足夠好」的終止條件。完整的評估套件是一個持續發現過程,從生產故障、用戶反饋和邊界案例逐步積累,而非預先完全猜測。自動評估代理可以並行處理數百個數據集項目,克服人工逐個審閱日誌的時間瓶頸。
- 7
4. 在線循環持續優化生產中的代理
- 8
部署後,診斷代理自動收集失效案例並進行結構化根因分析,聚類故障模式,生成新的評估標準和改進方案。這些學到的故障模式積累成可檢查的指標,無需逐個閱讀數百萬條日誌即可高效診斷問題。
- 9
--
實用技巧與重點
乾貨- 開發流程的七個階段:
- Spec(規格)- 定義職責、決策邊界、工具集成、約束條件
- Build(構建)- 實現規格,目標平台可選(支援多框架遷移)
- Eval(評估)- 構建評估套件(指標 + 測試數據)
- Ship(部署)- 代碼更新或代理平台直接部署
- Monitor(監控)- 持續監測生產日誌和故障
- Diagnose(診斷)- 根因分析和故障模式聚類
- Optimize(優化)- 生成特定改進方案並循環
- 評估的關鍵內容:
- 代理是否具有完整上下文
- 每個工具輸出是否正確
- 框架/運行時的影響評估
- 評估品質標準:
- 使用二元標準而非評分,提供明確的行動呼籲
- 需要 LLM 作為評判者的校準,降低評判方差
- Mutagen 平台組件(研究預覽):
- Evaluate Agent - 構建高質量評估數據集
- Diagnose Agent - 自動診斷生產日誌和故障
- 診斷工作流:
- 多層級過濾 - 智慧採樣代表性日誌而非讀全部
- 遞迴式根因分析 - 展示問題的完整因果鏈
- 修復建議多選 - 用戶可選擇推薦方案或多個方案組合
- 假設檢查 - 標註診斷做出的假設供人工驗證
- 技術框架:
- 框架名稱:Hermes、Deep Agents(代表新興競品)
- 支援多種日誌源:LangSmith、本地日誌、JSON-L 格式、觀測平台導出
- 運行環境:本地編碼環境(如 Claude Code)、未來計畫雲端託管服務
- --
結論
結論“通過讓代理自主執行開發循環中的評估、診斷和優化工作,Agentic AI Engineer 消除了人工審查瓶頸,使 AI 代理的大規模部署和持續改進成為可能。”
完整解析
詳細在 AI 代理開發的早期階段,團隊採用手工循環來構建和改進代理。流程是:當發現問題時,工程師實施變更,通過編碼代理生成樣本測試新功能,手動查看結果和日誌,決定是否發布,進行 A/B 測試,再基於反饋進行下一輪迭代。這個過程非常緩慢,人工審查和人工構建成為無法逾越的瓶頸——當組織計畫部署數百個 AI 代理時,這種模式完全無法擴展。
Agentic AI Engineer 是對這一模式的根本改造。它定義了一套完整的七階段循環,從規格定義開始。規格文檔是關鍵工件,需要明確定義代理的職責範圍、它將處理的任務、所需的工具和集成、上下文需求以及邊界條件。這份規格變成後續開發的藍圖,並且因為它是與實現細節分離的,所以當團隊需要在一年後從舊框架(如 Hermes)遷移到新框架時,只需調整實現層,規格本身保持不變。這種設計確保了長期的靈活性。
構建階段之後是評估驅動開發——相當於代理版本的測試驅動開發。完整的評估套件由兩部分組成:評估指標與評判標準,以及包含要測試的案例的數據集。大多數團隊犯的錯誤是試圖預先完整猜測所有評估標準,但現實是評估套件是一個持續發現的過程。它從生產故障、用戶反饋和邊界案例中逐步積累,代表了代理在真實環境中需要處理的具體挑戰。
當手工評估時,假設你有 200 個數據集項目,人工逐個審閱日誌和觀測平台會非常耗時,形成新的瓶頸。自動評估代理可以並行處理這些工作。評估的品質關鍵在於給出可操作的反饋——二元標準比評分更有價值,因為它們提供明確的「做什麼」指導。此外,如果使用 LLM 作為評判者,必須進行校準以減少評判方差,因為大語言模型在多次運行中可能給出不同評判。
代理部署到生產後,在線循環開始。診斷代理自動收集故障案例並執行結構化根因分析。關鍵洞察是,不應該人工讀遍所有日誌——一個擁有數百萬條代理追蹤的系統中,讀取成本超過執行成本本身。相反,診斷代理使用多層級過濾和智慧採樣策略,選擇代表性樣本,進行初步掃描以識別明顯問題,然後聚焦於特定故障模式。診斷結果以遞迴式根因分析呈現,展示「為什麼為什麼為什麼」的完整鏈條,並提供多個修復建議。過程中的假設會被明確標註,允許人工驗證。隨著時間推移,這些學到的故障模式積累成可檢查的代碼指標——比如特定的日誌內容或工具調用序列——這樣未來診斷就無需讀取完整日誌。
最終,一旦評估通過且改進方案確認,系統自動生成 Markdown 格式的任務定義供編碼代理使用,自動應用修復。這形成了一個完整的閉環:離線循環(Spec → Build → Eval → Ship)用於初期開發,在線循環(Monitor → Diagnose → Optimize)持續改進生產中的代理。每個生產故障轉化為新的評估標準,每個新的邊界案例豐富評估套件,讓代理越來越聰慧。
Mutagen 平台在研究預覽階段提供兩個核心代理:Evaluate Agent 幫助構建高質量的評估數據集,Diagnose Agent 自動分析生產追蹤。這些代理通過 Orchestrator(運行於編碼環境如 Claude Code)協調,連接到各種日誌源(LangSmith、本地文件、JSON-L 格式等)和目標平台(GitHub 自動提交、代理框架部署、託管服務)。用戶只需在編碼環境中輸入簡單命令(如 `/diagnose`)即可觸發整個工作流。
---
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


