AI Agent Harness, Loop Engineering, LLM Ops & Eval, Clearly Explained
三句話摘要
AI Agent系統的完整架構:通過Harness、Loop Engineering與LLM Ops三大機制,把大語言模型變成可控的智能系統。 Harness、Loop Engineering與LLM Ops三者合力,把大語言模型從強大但無方向的工具,轉變成自我監測、自我修復、持續進化的智能系統。 Harness的本質是控制機制:大語言模型像一匹強大但需要馴服的馬,Harness提供記憶系統、工具調用管理與迴路守衛,確保模型按預期運行而非隨機漫遊。
重點整理
重點- 1
Harness的本質是控制機制:大語言模型像一匹強大但需要馴服的馬,Harness提供記憶系統、工具調用管理與迴路守衛,確保模型按預期運行而非隨機漫遊。
- 2
記憶系統包含三層結構:程序記憶(指導Agent如何行動的文本與技能)、語義記憶(關於用戶的可靠事實)、情節記憶(時間序列的過往對話與事件),通過RAG與SQL查詢動態檢索。
- 3
Loop Engineering定義任務終點:Agent可能進行多次工具調用與思考,需設定明確的結束條件(確認任務完成、向用戶澄清目標),防止無限迴圈或不必要的成本支出。
- 4
LLM Ops建立健康檢查系統:通過Tracing追蹤每次Agent運行的完整事件樹,用Evaluation System(AI評分或代碼驗證)診斷問題原因,再根據診斷結果迭代提示詞、模型配置或檢索策略。
實用技巧與重點
乾貨- 工具與平台
- Harness框架:LangGraph、LangChain、Pydantic
- 記憶存儲:AWS、Supabase、Google Cloud、Azure
- 語義記憶:Consolidated after ~2,000 conversations(按需合併對話以降低成本)
- Tracing系統:Langfuse、LangSmith
- 集成對象:Salesforce、HubSpot、Automanus(CRM)、Stripe、Alipay(支付)、Slack、Claude Code(權限通知)
- 評估維度
- 任務完成度(如:會議是否真的被觸發)
- 響應時間(20秒 vs 2毫秒)
- Token消耗量
- 工具調用次數與質量
- 記憶檢索效率
- 迭代參數
- 系統提示詞版本
- 模型配置與選擇(成本 vs 質量權衡)
- 記憶檢索策略
- 迴路終止條件
結論
結論“Harness、Loop Engineering與LLM Ops三者合力,把大語言模型從強大但無方向的工具,轉變成自我監測、自我修復、持續進化的智能系統。”
完整解析
詳細AI Agent系統的核心問題在於:大語言模型雖然掌握人類知識,但不了解你。因此需要一套完整的Harness來馴服這匹強大但無方向的馬。
一個完整的Agent運行從用戶提問開始,系統將當前對話、用戶背景與操作指引打包成工作記憶(Context)餵給LLM。這份工作記憶由三層記憶系統支撐:程序記憶告訴Agent該如何行動,語義記憶提供用戶與組織的核心信息,情節記憶則保存歷史對話與事件的時間序列。所有記憶存放在數據庫中,Agent需要時透過檢索增強生成(RAG)或SQL查詢動態調取。例如電商場景中,若要找出「過去有哪些客戶投訴產品品質,且未被成功解決」,系統需要同時進行時間範圍查詢(SQL)與語義匹配(RAG),才能精準檢索真正相關的2,000條對話中的20條。
Agent在執行過程中往往需要多次調用工具——查詢CRM系統、觸發會議日程、發起退款。但問題是:Agent何時應該停止?這就是Loop Engineering的核心。迴路工程定義了任務終點,確保Agent不會無限循環或執行不必要的成本高昂操作。例如在客戶投訴處理流程中,Agent應先列出需要退款的8位客戶,然後詢問用戶:「我應該立即為這8人發起退款,還是只報告名單讓你稍後跟進?」明確的終止條件可防止意外成本,並確保人類保有最終決策權。
但系統如何持續進化?這需要LLM Ops的健康檢查機制。每次Agent運行都被完整追蹤(Tracing)為事件樹,記錄提問內容、檢索結果、工具調用次數、響應時間與Token消耗。評估系統(Evaluation)隨後以AI評分或代碼驗證判斷運行品質:會議是否真的被觸發?為什麼響應時間從2毫秒劇增到20秒?診斷階段則藉助分析儀表板找出瓶頸——可能是某個工具調用過慢、工作記憶過大導致檢索延遲、或根本不需要檢索某些簡單問題(如「我的生日是何時?」模型已知)。最後,基於診斷結果迭代提示詞版本、調整模型配置或檢索參數。若只是輕微問題,直接發布新版本;若是系統性故障,則重新回到開發階段。這套機制讓整個系統能像生命體般自我進化。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


