KeyFrame內部研究專用

四步构建企业级AI Agent架构!

白白说大模型·6月26日週五·9 min中文

三句話摘要

構建企業級AI Agent的工程化架構:透過評測、架構設計、工具解耦與免疫系統實現從不確定性到可控性的演進。 企業級Agent的真正門檻不在於炫技式的prompt技巧,而在於建立一個能自我修復、持續迭代的免疫系統,讓所有的評測反饋、bug修復與優化始終循環回流,驅動系統隨時間推移在不斷迭代中變得越來越穩定、越來越懂業務。 評測先行是根基:在寫第一行代碼前必須標註涵蓋核心業務邊界的50條黃金用例,這是衡量所有改動的絕對尺子,避免盲人摸象式的優化。對錯判斷標準由業務需求定義,不是看輸出文采好不好,而是有無幻覺與事實偏差。

重點整理

重點
  • 1

    評測先行是根基:在寫第一行代碼前必須標註涵蓋核心業務邊界的50條黃金用例,這是衡量所有改動的絕對尺子,避免盲人摸象式的優化。對錯判斷標準由業務需求定義,不是看輸出文采好不好,而是有無幻覺與事實偏差。

  • 2

    架構設計追求極簡:ReAct架構優於Plan & Execute,因為推理步驟越多中間環節越多,不可控的隨機性就成倍增加,如同做數學題步驟越多算錯的概率越大。架構複雜度與系統可控性成反比,極致輕量才能握住控制權。

  • 3

    工具解耦是約束機制:一個工具只幹一件事,功能拆得越細越好,工具說明文檔要精準避免模型猜測。RAG的核心職能不是查資料而是鎖定事實,替大模型加物理約束,強行框定生成範圍在客觀事實邊界。

  • 4

    免疫系統驅動進化:線上bad case才是寶貝,建立補貨機制歸因分析錯誤成因(大腦邏輯跳躍、記憶垃圾回源、工具參數偏差),所有優化反饋流入免疫系統循環加固整體架構。

實用技巧與重點

乾貨
  • 黃金用例數量:50條
  • 架構選型:ReAct(逐步思考→行動→觀察)vs Plan & Execute(全局規劃)
  • 工具原則:原子化設計,單一職責
  • RAG定位:事實鎖定機制,非單純查詢工具
  • 評測標準:排查幻覺與事實性偏差
  • 問題分類:大腦層(邏輯跳躍)、記憶層(垃圾回源)、工具層(參數偏差)
  • 系統架構四層:記憶與約束層→大腦層(推理)→肢體層(工具)→免疫系統(持續進化迴路)

結論

結論

企業級Agent的真正門檻不在於炫技式的prompt技巧,而在於建立一個能自我修復、持續迭代的免疫系統,讓所有的評測反饋、bug修復與優化始終循環回流,驅動系統隨時間推移在不斷迭代中變得越來越穩定、越來越懂業務。

完整解析

詳細

傳統軟件開發邏輯是死的,寫完程式測試通過就算完成,但AI Agent本質上是基於大語言模型的系統,具有兩層隨機性:模型本身的隨機性和模糊需求的不確定性。如果沿用先寫代碼再測試的方法,開發過程必然陷入修一個bug帶出三個新bug的惡性循環。根本症結是缺乏衡量標準——不知道是真的改聰明了模型,還是只是讓它瞎蒙得更順。

因此第一步必須業務方標註50條黃金用例,涵蓋核心業務邊界和高頻痛點。這50條用例成為系統絕對基準,所有後續改動都須經過這套回測機制驗證。判斷對錯的標準必須來自業務需求,而非模型輸出是否聽起來順口,關鍵是有無觸發幻覺或事實偏差。只有測試全部通過才敢上線。這本質上是用工程化手段將不確定性框進確定性。

第二步是大腦角色設計,需要選擇合適架構。ReAct架構每步都摆在外面,出問題容易排查;而Plan & Execute模式因為規劃路徑長、環節多,中間環節的隨機性成倍增加,就像數學題步驟越多越容易在某一步算錯。架構複雜度與系統可控性成反比,架構越簡潔,握著的控制權越多,幻覺也就越少。追求的是極致輕量,只要滿足業務目標就用最簡單邏輯,不要為所謂智能感堆砌複雜設計。

第三步工具解耦,原則是一個工具只幹一件事。給Agent複雜的萬能工具反而製造選擇困難症,模型容易邏輯偏離。工具說明文檔必須精準,含糊的說明會誘發模型腦補。其中RAG的角色特別重要——它的核心職能不是查資料,而是給大模型加物理約束,把事實喂進去,強行框定生成範圍在客觀事實邊界。工具越緊,模型決策負擔越小,幻覺概率越低。

第四步避錯進化,上線才是真正考驗的開始。必須建立線上補貨機制,抓線上bad case進行歸因分析:是大腦層的邏輯跳躍,還是記憶層的垃圾回源,還是工具層的參數偏差。這些問題要一個個拆解清楚。整個流程本質上是給系統建立優勝劣態的進化機制,通過不斷線上反馈和迭代,把原本不可控的隨機性一點點擠壓出去。整個企業級Agent開發不是線性的研發→發佈→維護,而是螺旋上升的進化過程。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。