KeyFrame內部研究專用

The Agentic AI Engineer - Benedikt Sanftl, Mutagent

AI Engineer·6月29日週一·34 min英文

三句話摘要

Agentic AI Engineer:通過自動化循環加速 AI 代理的開發、評估、部署與優化。 --- 通過讓代理自主執行開發循環中的評估、診斷和優化工作,Agentic AI Engineer 消除了人工審查瓶頸,使 AI 代理的大規模部署和持續改進成為可能。 1. 循環的自動化解決了擴展性困境

重點整理

重點
  • 1

    1. 循環的自動化解決了擴展性困境

  • 2

    傳統方式需要人工執行規格定義、構建、評估、部署、監控、診斷、優化等步驟,當代理數量增加到數百個時,人工審查變成無法突破的瓶頸。通過讓代理自主執行這些流程中的大部分工作,可以顯著提升迭代速度,在相同時間窗口內完成更多開發週期。

  • 3

    2. Spec 驅動開發確保長期靈活性

  • 4

    規格文檔是構建的藍圖,清晰定義了代理的職責、上下文需求、工具集成和邊界。因為框架演進迅速(Hermes、Deep Agents 等新框架不斷涌現),通過將規格與實現細節分離,團隊可以在一年後無痛遷移到新平台而無需重新設計。

  • 5

    3. Eval 驅動開發等同於代理版本的測試驅動開發

  • 6

    評估套件由指標、評判標準和測試數據集組成,是判斷代理是否「足夠好」的終止條件。完整的評估套件是一個持續發現過程,從生產故障、用戶反饋和邊界案例逐步積累,而非預先完全猜測。自動評估代理可以並行處理數百個數據集項目,克服人工逐個審閱日誌的時間瓶頸。

  • 7

    4. 在線循環持續優化生產中的代理

  • 8

    部署後,診斷代理自動收集失效案例並進行結構化根因分析,聚類故障模式,生成新的評估標準和改進方案。這些學到的故障模式積累成可檢查的指標,無需逐個閱讀數百萬條日誌即可高效診斷問題。

  • 9

    --

實用技巧與重點

乾貨
  • 開發流程的七個階段:
  • Spec(規格)- 定義職責、決策邊界、工具集成、約束條件
  • Build(構建)- 實現規格,目標平台可選(支援多框架遷移)
  • Eval(評估)- 構建評估套件(指標 + 測試數據)
  • Ship(部署)- 代碼更新或代理平台直接部署
  • Monitor(監控)- 持續監測生產日誌和故障
  • Diagnose(診斷)- 根因分析和故障模式聚類
  • Optimize(優化)- 生成特定改進方案並循環
  • 評估的關鍵內容:
  • 代理是否具有完整上下文
  • 每個工具輸出是否正確
  • 框架/運行時的影響評估
  • 評估品質標準:
  • 使用二元標準而非評分,提供明確的行動呼籲
  • 需要 LLM 作為評判者的校準,降低評判方差
  • Mutagen 平台組件(研究預覽):
  • Evaluate Agent - 構建高質量評估數據集
  • Diagnose Agent - 自動診斷生產日誌和故障
  • 診斷工作流:
  • 多層級過濾 - 智慧採樣代表性日誌而非讀全部
  • 遞迴式根因分析 - 展示問題的完整因果鏈
  • 修復建議多選 - 用戶可選擇推薦方案或多個方案組合
  • 假設檢查 - 標註診斷做出的假設供人工驗證
  • 技術框架:
  • 框架名稱:Hermes、Deep Agents(代表新興競品)
  • 支援多種日誌源:LangSmith、本地日誌、JSON-L 格式、觀測平台導出
  • 運行環境:本地編碼環境(如 Claude Code)、未來計畫雲端託管服務
  • --

結論

結論

通過讓代理自主執行開發循環中的評估、診斷和優化工作,Agentic AI Engineer 消除了人工審查瓶頸,使 AI 代理的大規模部署和持續改進成為可能。

完整解析

詳細

在 AI 代理開發的早期階段,團隊採用手工循環來構建和改進代理。流程是:當發現問題時,工程師實施變更,通過編碼代理生成樣本測試新功能,手動查看結果和日誌,決定是否發布,進行 A/B 測試,再基於反饋進行下一輪迭代。這個過程非常緩慢,人工審查和人工構建成為無法逾越的瓶頸——當組織計畫部署數百個 AI 代理時,這種模式完全無法擴展。

Agentic AI Engineer 是對這一模式的根本改造。它定義了一套完整的七階段循環,從規格定義開始。規格文檔是關鍵工件,需要明確定義代理的職責範圍、它將處理的任務、所需的工具和集成、上下文需求以及邊界條件。這份規格變成後續開發的藍圖,並且因為它是與實現細節分離的,所以當團隊需要在一年後從舊框架(如 Hermes)遷移到新框架時,只需調整實現層,規格本身保持不變。這種設計確保了長期的靈活性。

構建階段之後是評估驅動開發——相當於代理版本的測試驅動開發。完整的評估套件由兩部分組成:評估指標與評判標準,以及包含要測試的案例的數據集。大多數團隊犯的錯誤是試圖預先完整猜測所有評估標準,但現實是評估套件是一個持續發現的過程。它從生產故障、用戶反饋和邊界案例中逐步積累,代表了代理在真實環境中需要處理的具體挑戰。

當手工評估時,假設你有 200 個數據集項目,人工逐個審閱日誌和觀測平台會非常耗時,形成新的瓶頸。自動評估代理可以並行處理這些工作。評估的品質關鍵在於給出可操作的反饋——二元標準比評分更有價值,因為它們提供明確的「做什麼」指導。此外,如果使用 LLM 作為評判者,必須進行校準以減少評判方差,因為大語言模型在多次運行中可能給出不同評判。

代理部署到生產後,在線循環開始。診斷代理自動收集故障案例並執行結構化根因分析。關鍵洞察是,不應該人工讀遍所有日誌——一個擁有數百萬條代理追蹤的系統中,讀取成本超過執行成本本身。相反,診斷代理使用多層級過濾和智慧採樣策略,選擇代表性樣本,進行初步掃描以識別明顯問題,然後聚焦於特定故障模式。診斷結果以遞迴式根因分析呈現,展示「為什麼為什麼為什麼」的完整鏈條,並提供多個修復建議。過程中的假設會被明確標註,允許人工驗證。隨著時間推移,這些學到的故障模式積累成可檢查的代碼指標——比如特定的日誌內容或工具調用序列——這樣未來診斷就無需讀取完整日誌。

最終,一旦評估通過且改進方案確認,系統自動生成 Markdown 格式的任務定義供編碼代理使用,自動應用修復。這形成了一個完整的閉環:離線循環(Spec → Build → Eval → Ship)用於初期開發,在線循環(Monitor → Diagnose → Optimize)持續改進生產中的代理。每個生產故障轉化為新的評估標準,每個新的邊界案例豐富評估套件,讓代理越來越聰慧。

Mutagen 平台在研究預覽階段提供兩個核心代理:Evaluate Agent 幫助構建高質量的評估數據集,Diagnose Agent 自動分析生產追蹤。這些代理通過 Orchestrator(運行於編碼環境如 Claude Code)協調,連接到各種日誌源(LangSmith、本地文件、JSON-L 格式等)和目標平台(GitHub 自動提交、代理框架部署、託管服務)。用戶只需在編碼環境中輸入簡單命令(如 `/diagnose`)即可觸發整個工作流。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。