Continual Learning for AI Agents: From Failures to Durable Improvements - Soheil Feizi, RELAI
三句話摘要
AI 代理的持續學習:從單次失敗轉化為可重放的測試環境,通過可驗證的最小化改進實現永久進步。 AI 代理的持續學習不是單純的模型微調,而是透過將生產日誌轉化為可重放的測試環境,以四項原則(可重放性、整體性、終身學習性、效率)為指導,在模型、框架與記憶三層協調尋找最小改變,確保每次改進都經過驗證且不遺忘過去成功——這是實現永久進步而非短期過擬的關鍵。 反饋來源層級不同。開發階段可用基準測試+評估器打分;生產階段只有會話日誌,需透過自動分析(其他模型或 LLM)或人類專家(提供領域知識)萃取反饋。但日誌加反饋仍不足——需升級為「可重放的學習環境」,包含推斷的工具行為、合成使用者、成功指標定義,才能對多個代理候選版本進行測試與驗證。
重點整理
重點- 1
反饋來源層級不同。開發階段可用基準測試+評估器打分;生產階段只有會話日誌,需透過自動分析(其他模型或 LLM)或人類專家(提供領域知識)萃取反饋。但日誌加反饋仍不足——需升級為「可重放的學習環境」,包含推斷的工具行為、合成使用者、成功指標定義,才能對多個代理候選版本進行測試與驗證。
- 2
改進層級決定成本與彈性。模型層改進(SFT、DPO、RLVR、LoRA)需要密集計算但強大;框架層改進(重寫提示詞、修改工具、程式流程)靈活成本中等;記憶層改進(存儲事實、技能蒸餾)最快最便宜但未經驗證。最佳策略不專注單一層,而是找到能解釋失敗的最小持久改變。
- 3
可驗證持續學習(VCL)的核心是四原則的協調。可重放性確保一次性失敗變成可重複測試;整體性通過根因分析將修復路由至正確層級;終身學習性在優化時內嵌回歸測試,新修復不破壞過往成功;效率讓迴圈頻繁運行,優化過程本身也要高效。
- 4
Reli 的實現方式簡單實用:兩條指令即可整合到現有代理——先設定學習框架(one-time),再透過信號(日誌、反饋或指令)創建學習環境、調用優化,每次輸出可審查的版本更新說明改變與改進原因。
實用技巧與重點
乾貨- 框架層方法名稱
- Trace-to-Harness:分析日誌及反饋,用編碼代理改進框架
- GEPA、Prom-SURGE:變異提示詞、評分候選、用演化算法保留勝者
- 記憶層方法名稱
- LETTA、MEM-ZERO:存儲事實或修正
- Scale Distillation:將成功軌跡壓縮為可重用的技能
- 模型層方法名稱
- SFT(Supervised Fine-Tuning):模仿正確軌跡
- DPO、GRPO、RLVR:基於獎勵或偏好信號的強化學習微調
- LoRA(Low-Rank Adaptation):限制可改變參數範圍
- Reli 平台命令
- 建立學習框架:一次性設定
- `rely create learning environments`:用日誌、反饋或指令創建可重放環境
- `rely optimize`:呼叫全能優化器進行整體改進
- 具體數據(演講示例中的 Continual Learning Benchmark)
- 虛構支援代理測試床,包含確定性評估器
- 模擬器含有:角色personas、意圖intent、模擬或真實工具、成功指標評估器
- 初始分數 78%(單個迴圈後改進至 97%)
- 平均改進幅度:10%
- 四大原則
- 可重放性(Replayability):將一次性失敗轉化為可重放測試
- 整體性(Holisticness):一個失敗可能有多個成因,需路由至正確層級
- 終身學習性(Lifelongness):新修復須改進新案例而不破壞過往K個學習環境
- 效率(Efficiency):修改成本從便宜(記憶)到昂貴(模型);優化迴圈本身也需高效
結論
結論“AI 代理的持續學習不是單純的模型微調,而是透過將生產日誌轉化為可重放的測試環境,以四項原則(可重放性、整體性、終身學習性、效率)為指導,在模型、框架與記憶三層協調尋找最小改變,確保每次改進都經過驗證且不遺忘過去成功——這是實現永久進步而非短期過擬的關鍵。”
完整解析
詳細AI 代理的持續學習面臨兩個根本性挑戰:如何獲得反饋和如何根據反饋行動。講者透過對比人類學習方式(互動、反饋、改進、不遺忘)引出問題的緣起。在開發階段,團隊通常透過精心設計的基準測試與評估器來評分代理行為;但在生產環境中,這些資源並不存在,只有使用者與代理互動的會話日誌。
提取反饋的方法有二:自動化方式使用其他模型或 LLM 分析日誌,具有規模性優勢;人類專家審視日誌雖然量少,卻提供寶貴的領域知識與對齊方向。但單有日誌加反饋還不夠——它們仍然不可測試。講者指出關鍵的缺失是「可重放的學習環境」,需要從一次性的觀察推斷出一個可模擬與評估的環境。這涉及理解工具該如何表現(真實或模擬)、如何從互動推斷合成使用者,以及如何定義該環境中的成功標準。一旦建立起這樣的環境,就可以測試多個代理候選版本,驗證修復的有效性。
改進 AI 代理有三個層級:模型層(改變權重,方法如監督微調 SFT 或強化學習如 DPO、LoRA 限制參數量),通常計算昂貴但有力;框架層(改寫提示詞、修改工具、改變程式流程),靈活但需驗證;記憶層(存儲事實、蒸餾技能),最便宜快速但通常未驗證。講者強調,優秀的學習引擎應尋求「正確層級的最小持久改變」,而非針對單一層級。
講者隨後介紹了「可驗證的持續學習」(VCL)的四項原則。可重放性要求將失敗轉化為可重複執行的測試;整體性意味著一個失敗可能有多個成因(例如代理採用過時政策可能來自記憶中的陳舊事實、優化不足的提示詞、未正規化的工具或需要新的工作流程),修復必須路由至最適層級。終身學習性最具挑戰——新修復必須在改進新案例時不破壞過去 K 個學習環境上的成功,這要求迴圈本身內嵌回歸測試而非事後檢查。效率則涉及改動成本的多樣性與優化迴圈自身的速度。
Reli 的實現簡潔:只需透過兩條命令整合到現有代理框架中。首先一次性設定學習框架;其後可根據日誌、反饋或指令創建學習環境,再呼叫優化函數進行整體改進,輸出是一份可審查的版本更新,明確說明改變內容與改進原因。演講中的虛構支援代理示例展示了流程:從指令建立學習環境(包含角色、意圖、工具、評估器),到模擬測試(初始分數 78%),再經優化迴圈(改進至 97%)。在生產場景中,代理也可從日誌與人類反饋(如「保留快速符合資格的退款但不超過門檻」)持續改進,每次都經過可驗證的迴圈,測試新修復並防止回歸。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


