KeyFrame內部研究專用

Continual Learning for AI Agents: From Failures to Durable Improvements - Soheil Feizi, RELAI

AI Engineer·7月5日週日·22 min英文

三句話摘要

AI 代理的持續學習:從單次失敗轉化為可重放的測試環境,通過可驗證的最小化改進實現永久進步。 AI 代理的持續學習不是單純的模型微調,而是透過將生產日誌轉化為可重放的測試環境,以四項原則(可重放性、整體性、終身學習性、效率)為指導,在模型、框架與記憶三層協調尋找最小改變,確保每次改進都經過驗證且不遺忘過去成功——這是實現永久進步而非短期過擬的關鍵。 反饋來源層級不同。開發階段可用基準測試+評估器打分;生產階段只有會話日誌,需透過自動分析(其他模型或 LLM)或人類專家(提供領域知識)萃取反饋。但日誌加反饋仍不足——需升級為「可重放的學習環境」,包含推斷的工具行為、合成使用者、成功指標定義,才能對多個代理候選版本進行測試與驗證。

重點整理

重點
  • 1

    反饋來源層級不同。開發階段可用基準測試+評估器打分;生產階段只有會話日誌,需透過自動分析(其他模型或 LLM)或人類專家(提供領域知識)萃取反饋。但日誌加反饋仍不足——需升級為「可重放的學習環境」,包含推斷的工具行為、合成使用者、成功指標定義,才能對多個代理候選版本進行測試與驗證。

  • 2

    改進層級決定成本與彈性。模型層改進(SFT、DPO、RLVR、LoRA)需要密集計算但強大;框架層改進(重寫提示詞、修改工具、程式流程)靈活成本中等;記憶層改進(存儲事實、技能蒸餾)最快最便宜但未經驗證。最佳策略不專注單一層,而是找到能解釋失敗的最小持久改變。

  • 3

    可驗證持續學習(VCL)的核心是四原則的協調。可重放性確保一次性失敗變成可重複測試;整體性通過根因分析將修復路由至正確層級;終身學習性在優化時內嵌回歸測試,新修復不破壞過往成功;效率讓迴圈頻繁運行,優化過程本身也要高效。

  • 4

    Reli 的實現方式簡單實用:兩條指令即可整合到現有代理——先設定學習框架(one-time),再透過信號(日誌、反饋或指令)創建學習環境、調用優化,每次輸出可審查的版本更新說明改變與改進原因。

實用技巧與重點

乾貨
  • 框架層方法名稱
  • Trace-to-Harness:分析日誌及反饋,用編碼代理改進框架
  • GEPA、Prom-SURGE:變異提示詞、評分候選、用演化算法保留勝者
  • 記憶層方法名稱
  • LETTA、MEM-ZERO:存儲事實或修正
  • Scale Distillation:將成功軌跡壓縮為可重用的技能
  • 模型層方法名稱
  • SFT(Supervised Fine-Tuning):模仿正確軌跡
  • DPO、GRPO、RLVR:基於獎勵或偏好信號的強化學習微調
  • LoRA(Low-Rank Adaptation):限制可改變參數範圍
  • Reli 平台命令
  • 建立學習框架:一次性設定
  • `rely create learning environments`:用日誌、反饋或指令創建可重放環境
  • `rely optimize`:呼叫全能優化器進行整體改進
  • 具體數據(演講示例中的 Continual Learning Benchmark)
  • 虛構支援代理測試床,包含確定性評估器
  • 模擬器含有:角色personas、意圖intent、模擬或真實工具、成功指標評估器
  • 初始分數 78%(單個迴圈後改進至 97%)
  • 平均改進幅度:10%
  • 四大原則
  • 可重放性(Replayability):將一次性失敗轉化為可重放測試
  • 整體性(Holisticness):一個失敗可能有多個成因,需路由至正確層級
  • 終身學習性(Lifelongness):新修復須改進新案例而不破壞過往K個學習環境
  • 效率(Efficiency):修改成本從便宜(記憶)到昂貴(模型);優化迴圈本身也需高效

結論

結論

AI 代理的持續學習不是單純的模型微調,而是透過將生產日誌轉化為可重放的測試環境,以四項原則(可重放性、整體性、終身學習性、效率)為指導,在模型、框架與記憶三層協調尋找最小改變,確保每次改進都經過驗證且不遺忘過去成功——這是實現永久進步而非短期過擬的關鍵。

完整解析

詳細

AI 代理的持續學習面臨兩個根本性挑戰:如何獲得反饋和如何根據反饋行動。講者透過對比人類學習方式(互動、反饋、改進、不遺忘)引出問題的緣起。在開發階段,團隊通常透過精心設計的基準測試與評估器來評分代理行為;但在生產環境中,這些資源並不存在,只有使用者與代理互動的會話日誌。

提取反饋的方法有二:自動化方式使用其他模型或 LLM 分析日誌,具有規模性優勢;人類專家審視日誌雖然量少,卻提供寶貴的領域知識與對齊方向。但單有日誌加反饋還不夠——它們仍然不可測試。講者指出關鍵的缺失是「可重放的學習環境」,需要從一次性的觀察推斷出一個可模擬與評估的環境。這涉及理解工具該如何表現(真實或模擬)、如何從互動推斷合成使用者,以及如何定義該環境中的成功標準。一旦建立起這樣的環境,就可以測試多個代理候選版本,驗證修復的有效性。

改進 AI 代理有三個層級:模型層(改變權重,方法如監督微調 SFT 或強化學習如 DPO、LoRA 限制參數量),通常計算昂貴但有力;框架層(改寫提示詞、修改工具、改變程式流程),靈活但需驗證;記憶層(存儲事實、蒸餾技能),最便宜快速但通常未驗證。講者強調,優秀的學習引擎應尋求「正確層級的最小持久改變」,而非針對單一層級。

講者隨後介紹了「可驗證的持續學習」(VCL)的四項原則。可重放性要求將失敗轉化為可重複執行的測試;整體性意味著一個失敗可能有多個成因(例如代理採用過時政策可能來自記憶中的陳舊事實、優化不足的提示詞、未正規化的工具或需要新的工作流程),修復必須路由至最適層級。終身學習性最具挑戰——新修復必須在改進新案例時不破壞過去 K 個學習環境上的成功,這要求迴圈本身內嵌回歸測試而非事後檢查。效率則涉及改動成本的多樣性與優化迴圈自身的速度。

Reli 的實現簡潔:只需透過兩條命令整合到現有代理框架中。首先一次性設定學習框架;其後可根據日誌、反饋或指令創建學習環境,再呼叫優化函數進行整體改進,輸出是一份可審查的版本更新,明確說明改變內容與改進原因。演講中的虛構支援代理示例展示了流程:從指令建立學習環境(包含角色、意圖、工具、評估器),到模擬測試(初始分數 78%),再經優化迴圈(改進至 97%)。在生產場景中,代理也可從日誌與人類反饋(如「保留快速符合資格的退款但不超過門檻」)持續改進,每次都經過可驗證的迴圈,測試新修復並防止回歸。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。