KeyFrame內部研究專用

Reinforcement Learning without Verifiable Rewards — Will Brown, Prime Intellect

AI Engineer·7月31日週五·19 min英文

三句話摘要

如何在缺乏明確可驗證獎勵的現實世界任務中應用強化學習,構建能夠自主學習與持續改進的智能代理系統。 強化學習的未來不在於追求完美的奪勵標籤,而在於用計算資源自動從現實數據中提取隱性信號,最終讓代理在生產環境中自主學習、持續進化。 現實世界任務的獎勵信號危機:撰寫報告、處理退款、用戶互動等複雜任務缺乏客觀的評判標準。傳統強化學習依賴明確獎勵來指導模型優化,這種信號缺失使得訓練無法進行,需要探索從模糊反饋中可靠提取學習信號的新方法。

重點整理

重點
  • 1

    現實世界任務的獎勵信號危機:撰寫報告、處理退款、用戶互動等複雜任務缺乏客觀的評判標準。傳統強化學習依賴明確獎勵來指導模型優化,這種信號缺失使得訓練無法進行,需要探索從模糊反饋中可靠提取學習信號的新方法。

  • 2

    多元信號生成策略:可透過基礎測試(A/B對比揭示性能差距)、利用LLM作為通用評判者、從生產軌跡中挖掘用戶提示與代理調用日誌、對文檔進行反向工程(從答案推導問題)等方式,不依賴預先標注而人工創造學習信號。

  • 3

    模擬器基礎設施的核心價值:透過構建生產環境的高保真模擬器,可實現真實環境無法做到的驗證操作——種入答案、反向推導、完全控制後端狀態。模擬器質量可藉由持續用生產數據迭代、投入計算資源搜索複雜行為來逐步提升。

  • 4

    持續學習的自進化閉環:最終目標是部署代理自主發現生產環節中的錯誤、自動轉化為訓練任務、透過強化學習改進自身,形成不需人工干預的自進化系統。人類角色下沈至高層判斷(好/壞),而非參與低層細節。

實用技巧與重點

乾貨
  • 基礎設施與工具
  • Primordial RL 訓練框架、Lab 訓練平台(托管訓練、評估、推理、實驗監控)、環境建構工具、任務集、工具箱、驗證器
  • 信號來源
  • 生產軌跡:用戶提示、代理間調用記錄
  • 文檔資源:語料庫採樣、問答對生成、答案驗證
  • 代碼資源:真實PR、差異、測試案例、文件分解
  • 行為軌跡:Web應用使用日誌、MCP工具調用、CLI命令
  • 任務生成方法
  • 基礎測試(grounded testing):A/B對比創造優勢差距
  • 反向工程:從解決方案或接近解決方案的狀態往上回溯
  • 文檔反轉:採樣→生成問題→驗證→丟棄初始問題
  • 工件分解:將完整代碼拆分成子任務,回放至已知可達成的最終狀態
  • 獎勵信號優化
  • LLM 法官評分、搜尋擴展、難度調整、紅隊演練、對抗性提示優化
  • 追蹤挖掘:離線分析失敗案例、構建獎勵漏洞語料庫
  • 追蹤驗證:工具調用指標、行為模式分析、小規模試驗運行
  • 風險管控
  • 獎勵破解(reward hacking):模型找到滿足獎勵但違反真意的路徑
  • 防控手段:事後反思、計算資源改進獎勵機制、多模型一致性檢驗
  • 相關發表
  • 通用代理(Universal Agent):線上循環的任務生成、解決、合成,按通過率門控訓練
  • Echo 專案:結合強化學習與監督學習信號,讓模型建立環境世界模型

結論

結論

強化學習的未來不在於追求完美的奪勵標籤,而在於用計算資源自動從現實數據中提取隱性信號,最終讓代理在生產環境中自主學習、持續進化。

完整解析

詳細

威爾·布朗在本次演講中指出,強化學習面臨一個根本性困境:現實世界中的大多數智能代理任務——包括撰寫分析報告、預訂機票、處理退款、與用戶互動——都缺乏客觀定義的「正確答案」。傳統強化學習依靠明確的獎勵信號指導模型通過策略梯度優化自身,但當任務本身的邊界未定義、目標模糊時,這種清晰信號根本無法獲取。即便人工標注也極其耗時且不夠精準,尤其是對開放式、無限制的現實環境。

面對這個挑戰,講者提出了一套系統的替代方案,核心思想是「充分利用計算資源從現有數據中人工生成隱性獎勵信號」。第一層是基礎測試:通過 A/B 對比,揭示模型在擁有更多上下文時的性能差異,這個差異本身就構成了學習信號。第二層是利用 LLM 本身強大的推理能力——將模型當作通用「法官」,花費計算時間評估代理行為的好壞。第三層是從生產環境中挖掘原始軌跡數據:已部署系統的用戶提示、代理間的調用記錄、執行日誌等,這些數據雖然未標注但代表真實分布,隨著時間累積會形成分布先驗。第四層是反向工程思路:從文檔庫採樣、讓模型生成答案、驗證答案正確性,再丟棄初始問題,讓模型學會從答案反推任務——既获得了監督信號,又創造了符合實際的訓練任務。

強化學習的基礎設施則是高保真模擬器。Primordial 團隊發現,透過結合通用後端基礎設施、測試時計算擴展(test-time scaling)與搜索能力,可以構建生產環境的精密模擬。這些模擬器的獨特價值在於——可以實現真實環境無法實現的操作:直接種入答案、反向推導解決方案路徑、完全控制後端狀態以進行確定性驗證。模擬器質量不是一成不變的,而是可以通過不斷用生產軌跡改進、投入計算資源搜索複雜行為並讓代理學習改進實現,逐步提升保真度。在這過程中需要警惕「獎勵破解」現象——模型可能會找到滿足獎勵信號但實際不符合真實目的的解決方案。防控手段包括紅隊演練、對抗性提示優化、事後追蹤挖掘與多模型一致性檢驗。

最終願景是建立持續學習的閉環系統。已部署的代理在真實生產環境中執行任務時會犯錯,系統能自動觀察這些錯誤、生成對應的訓練任務、利用改進的模擬器進行強化學習,再部署更優的版本——整個過程形成自進化迴圈。人類專家的角色下沈至高層判斷層面(決定「這是好的還是壞的」),而非參與低層細節微調。Primordial 已通過發表的項目(如「通用代理」展示的線上循環架構)和與研究者合作的 Echo 項目(同時融合強化學習和監督學習信號以建立環境世界模型),逐步驗證這套方法的可行性。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。