KeyFrame內部研究專用

AI Agent Harness, Loop Engineering, LLM Ops & Eval, Clearly Explained

Sean‘s AI Stories and AutoManus·6月26日週五·20 min英文

三句話摘要

AI Agent系統的完整架構:通過Harness、Loop Engineering與LLM Ops三大機制,把大語言模型變成可控的智能系統。 Harness、Loop Engineering與LLM Ops三者合力,把大語言模型從強大但無方向的工具,轉變成自我監測、自我修復、持續進化的智能系統。 Harness的本質是控制機制:大語言模型像一匹強大但需要馴服的馬,Harness提供記憶系統、工具調用管理與迴路守衛,確保模型按預期運行而非隨機漫遊。

重點整理

重點
  • 1

    Harness的本質是控制機制:大語言模型像一匹強大但需要馴服的馬,Harness提供記憶系統、工具調用管理與迴路守衛,確保模型按預期運行而非隨機漫遊。

  • 2

    記憶系統包含三層結構:程序記憶(指導Agent如何行動的文本與技能)、語義記憶(關於用戶的可靠事實)、情節記憶(時間序列的過往對話與事件),通過RAG與SQL查詢動態檢索。

  • 3

    Loop Engineering定義任務終點:Agent可能進行多次工具調用與思考,需設定明確的結束條件(確認任務完成、向用戶澄清目標),防止無限迴圈或不必要的成本支出。

  • 4

    LLM Ops建立健康檢查系統:通過Tracing追蹤每次Agent運行的完整事件樹,用Evaluation System(AI評分或代碼驗證)診斷問題原因,再根據診斷結果迭代提示詞、模型配置或檢索策略。

實用技巧與重點

乾貨
  • 工具與平台
  • Harness框架:LangGraph、LangChain、Pydantic
  • 記憶存儲:AWS、Supabase、Google Cloud、Azure
  • 語義記憶:Consolidated after ~2,000 conversations(按需合併對話以降低成本)
  • Tracing系統:Langfuse、LangSmith
  • 集成對象:Salesforce、HubSpot、Automanus(CRM)、Stripe、Alipay(支付)、Slack、Claude Code(權限通知)
  • 評估維度
  • 任務完成度(如:會議是否真的被觸發)
  • 響應時間(20秒 vs 2毫秒)
  • Token消耗量
  • 工具調用次數與質量
  • 記憶檢索效率
  • 迭代參數
  • 系統提示詞版本
  • 模型配置與選擇(成本 vs 質量權衡)
  • 記憶檢索策略
  • 迴路終止條件

結論

結論

Harness、Loop Engineering與LLM Ops三者合力,把大語言模型從強大但無方向的工具,轉變成自我監測、自我修復、持續進化的智能系統。

完整解析

詳細

AI Agent系統的核心問題在於:大語言模型雖然掌握人類知識,但不了解你。因此需要一套完整的Harness來馴服這匹強大但無方向的馬。

一個完整的Agent運行從用戶提問開始,系統將當前對話、用戶背景與操作指引打包成工作記憶(Context)餵給LLM。這份工作記憶由三層記憶系統支撐:程序記憶告訴Agent該如何行動,語義記憶提供用戶與組織的核心信息,情節記憶則保存歷史對話與事件的時間序列。所有記憶存放在數據庫中,Agent需要時透過檢索增強生成(RAG)或SQL查詢動態調取。例如電商場景中,若要找出「過去有哪些客戶投訴產品品質,且未被成功解決」,系統需要同時進行時間範圍查詢(SQL)與語義匹配(RAG),才能精準檢索真正相關的2,000條對話中的20條。

Agent在執行過程中往往需要多次調用工具——查詢CRM系統、觸發會議日程、發起退款。但問題是:Agent何時應該停止?這就是Loop Engineering的核心。迴路工程定義了任務終點,確保Agent不會無限循環或執行不必要的成本高昂操作。例如在客戶投訴處理流程中,Agent應先列出需要退款的8位客戶,然後詢問用戶:「我應該立即為這8人發起退款,還是只報告名單讓你稍後跟進?」明確的終止條件可防止意外成本,並確保人類保有最終決策權。

但系統如何持續進化?這需要LLM Ops的健康檢查機制。每次Agent運行都被完整追蹤(Tracing)為事件樹,記錄提問內容、檢索結果、工具調用次數、響應時間與Token消耗。評估系統(Evaluation)隨後以AI評分或代碼驗證判斷運行品質:會議是否真的被觸發?為什麼響應時間從2毫秒劇增到20秒?診斷階段則藉助分析儀表板找出瓶頸——可能是某個工具調用過慢、工作記憶過大導致檢索延遲、或根本不需要檢索某些簡單問題(如「我的生日是何時?」模型已知)。最後,基於診斷結果迭代提示詞版本、調整模型配置或檢索參數。若只是輕微問題,直接發布新版本;若是系統性故障,則重新回到開發階段。這套機制讓整個系統能像生命體般自我進化。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。