The Missing Layer After Launch - Raphael Kalandadze, Wandero AI
三句話摘要
部署AI agent後的監控與改進系統——被忽視的關鍵工作層。 構建生產級agent不是在上線時完成,而是需要先建立自我監控和反饋閉合的系統,這個系統本身就是一個agent問題,需要專門的架構和投入來解決。 部署是真正工作的開始
重點整理
重點- 1
部署是真正工作的開始
- 2
講者指出大多數agent相關討論在上線時終止,但實際上部署後才需要快速閉合反饋迴圈——監控、理解系統表現、檢測問題、修復改進。這個反饋迴圈對產品進化至關重要,有時甚至比系統本身更重要。
- 3
Agent監控比傳統軟體複雜得多
- 4
Agent系統具有非確定性,相同輸入可能產生完全不同的輸出,單元測試和規則檢查無法預先覆蓋所有情況。生產環境才是你真正發現「應該測試什麼」的地方,而這無法提前寫下來。
- 5
隱蔽式故障是最大威脅
- 6
Agent可能在長時間運行中陷入困境但透過運氣或替代方案侥幸恢復,表面看不到任何告警信號,卻隱示代碼庫中存在潛在問題必須立即修復。此外,agent有時聲稱任務完成卻未實際驗證——「技術成功」但用戶不滿意(如預訂錯誤服務、價格計算有誤)。
- 7
需要多層系統形成自我監控的閉環
- 8
包含實時日誌監控agent(小時級檢測具體問題)、會話分析agent(周級提供系統健康全景)、計算機使用agent(使用者視角驗證UI)、以及獨立審查agent(批判性檢視所有輸出),串連軌跡、指標、代碼庫、資料庫與UI。
實用技巧與重點
乾貨- 日誌監控agent
- 執行頻率:每小時或每15分鐘
- 輸出物:PR包含描述、元數據、圖表、ASCII表、HTML工件;或發送Slack警報
- 特點:快速、即時、聚焦具體問題
- 審查agent
- 角色:從不同角度獨立檢驗PR,評分、提出改進或直接關閉
- 成效:與日誌agent合作,每天輸出數量為三人手工作業的10倍
- 會話分析agent(Session Analyzer)
- 計算指標:健康評分、成功率、成本、趨勢、工具使用次數、子agent調用數、摘要次數
- 輸出視覺化:評分分佈、情感分析、實體標註、工具成本分析、詳細會話排名
- 執行頻率:每週或兩週一次
- 特點:高層理解、連點成線找模式、AI洞察
- 計算機使用agent
- 功能:打開瀏覽器、登入系統、模擬使用者操作、檢驗UI外觀和工件
- 需求:需要自訂技能以加速執行、消耗較多token
- 系統需求
- 給agent完整工具存取:軌跡、指標、資料庫、代碼庫、UI等所有必要資源
- 形成「meta harness」——所有元件相連、互相印證、自我監控
結論
結論“構建生產級agent不是在上線時完成,而是需要先建立自我監控和反饋閉合的系統,這個系統本身就是一個agent問題,需要專門的架構和投入來解決。”
完整解析
詳細Agent產品上線後,大多數討論就此結束,但講者認為這正是真正工作的開始。常見的敘述是:「我們構建了agent,上線了,一切運作良好」——就此終止。但實際上,部署標誌著反饋迴圈的起點,這個迴圈與產品本身同樣重要。核心問題是:你如何知道agent在生產環境中真正有效?如何監控數百甚至數千個真實對話?系統健康嗎?這就是講者所說的「缺失的一層」。
傳統的安全網——單元測試、正則規則檢查、模擬腳本——在agent系統中效果有限。Agent系統的非確定性特徵使其與傳統軟體根本不同。LLM的同樣輸入可能產生完全不同的輸出,即使微小的輸入修改也能改變整個執行軌跡。覆蓋空間無限,你無法提前預測和測試所有情況。這意味著直到上線到生產環境,你才真正了解agent會做什麼。
最隱蔽的威脅來自失敗的表現形式。想像agent在執行長任務中陷入困境,無法進展,但透過運氣或試驗不同的工具調用組合,意外地恢復了執行進度。表面上,你的監控儀表板看不到任何告警,一切看起來都很好。但這種「幸運恢復」實際上隱示了代碼庫中潛在的設計缺陷或邏輯漏洞,需要盡快修復。否則,當這種運氣用盡時,系統的可靠性就會大幅下降。此外,agent有時會熱情地聲稱任務完成,卻未實際驗證功能是否正常——技術上「成功」但用戶並不滿意,例如預訂了錯誤的服務、價格計算有誤,或使用者體驗不符合期望。
為了解決這個問題,講者建立了一個多層面的agent系統。首先是日誌監控agent,它每小時或每15分鐘執行一次,獲取完整的軌跡、日誌和代碼庫存取權限,自動診斷問題並生成PR或發送Slack警報。這些PR附帶清晰的描述、元數據、圖表和HTML工件,幫助開發者快速理解問題。隨後是獨立的審查agent,它從不同角度評估PR,提出批判性意見、要求改進或直接關閉不必要的PR。這樣可以過濾掉不必要的修改,同時兩個agent合力發送的PR數量是團隊三人手工工作的10倍。
其次是會話分析agent,它提供系統的高層健康狀態全景。透過分析所有對話,計算健康評分、成功率、成本、執行趨勢、工具使用統計,並使用AI洞察連接點點成線,發現模式和潛在的集群問題。這個系統通常每週或兩週執行一次,讓團隊對系統整體表現有把握。最後是計算機使用agent,它打開真實瀏覽器、登入系統、模擬實際使用者操作流程,從使用者視角驗證UI和功能是否正常工作。
這整個系統被講者稱為「meta harness」——一個自我監控、自我理解、自我改進的完整生態。輸出的PR和結論不依賴於開發者的主觀判斷,而是根據真實問題從軌跡、日誌、代碼庫、資料庫、UI等多個角度驗證而來。系統的力量不在於底層的LLM模型,而在於圍繞模型構建的整個監控和反饋機制。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


