Reinforcement Learning without Verifiable Rewards — Will Brown, Prime Intellect
三句話摘要
如何在缺乏明確可驗證獎勵的現實世界任務中應用強化學習,構建能夠自主學習與持續改進的智能代理系統。 強化學習的未來不在於追求完美的奪勵標籤,而在於用計算資源自動從現實數據中提取隱性信號,最終讓代理在生產環境中自主學習、持續進化。 現實世界任務的獎勵信號危機:撰寫報告、處理退款、用戶互動等複雜任務缺乏客觀的評判標準。傳統強化學習依賴明確獎勵來指導模型優化,這種信號缺失使得訓練無法進行,需要探索從模糊反饋中可靠提取學習信號的新方法。
重點整理
重點- 1
現實世界任務的獎勵信號危機:撰寫報告、處理退款、用戶互動等複雜任務缺乏客觀的評判標準。傳統強化學習依賴明確獎勵來指導模型優化,這種信號缺失使得訓練無法進行,需要探索從模糊反饋中可靠提取學習信號的新方法。
- 2
多元信號生成策略:可透過基礎測試(A/B對比揭示性能差距)、利用LLM作為通用評判者、從生產軌跡中挖掘用戶提示與代理調用日誌、對文檔進行反向工程(從答案推導問題)等方式,不依賴預先標注而人工創造學習信號。
- 3
模擬器基礎設施的核心價值:透過構建生產環境的高保真模擬器,可實現真實環境無法做到的驗證操作——種入答案、反向推導、完全控制後端狀態。模擬器質量可藉由持續用生產數據迭代、投入計算資源搜索複雜行為來逐步提升。
- 4
持續學習的自進化閉環:最終目標是部署代理自主發現生產環節中的錯誤、自動轉化為訓練任務、透過強化學習改進自身,形成不需人工干預的自進化系統。人類角色下沈至高層判斷(好/壞),而非參與低層細節。
實用技巧與重點
乾貨- 基礎設施與工具
- Primordial RL 訓練框架、Lab 訓練平台(托管訓練、評估、推理、實驗監控)、環境建構工具、任務集、工具箱、驗證器
- 信號來源
- 生產軌跡:用戶提示、代理間調用記錄
- 文檔資源:語料庫採樣、問答對生成、答案驗證
- 代碼資源:真實PR、差異、測試案例、文件分解
- 行為軌跡:Web應用使用日誌、MCP工具調用、CLI命令
- 任務生成方法
- 基礎測試(grounded testing):A/B對比創造優勢差距
- 反向工程:從解決方案或接近解決方案的狀態往上回溯
- 文檔反轉:採樣→生成問題→驗證→丟棄初始問題
- 工件分解:將完整代碼拆分成子任務,回放至已知可達成的最終狀態
- 獎勵信號優化
- LLM 法官評分、搜尋擴展、難度調整、紅隊演練、對抗性提示優化
- 追蹤挖掘:離線分析失敗案例、構建獎勵漏洞語料庫
- 追蹤驗證:工具調用指標、行為模式分析、小規模試驗運行
- 風險管控
- 獎勵破解(reward hacking):模型找到滿足獎勵但違反真意的路徑
- 防控手段:事後反思、計算資源改進獎勵機制、多模型一致性檢驗
- 相關發表
- 通用代理(Universal Agent):線上循環的任務生成、解決、合成,按通過率門控訓練
- Echo 專案:結合強化學習與監督學習信號,讓模型建立環境世界模型
結論
結論“強化學習的未來不在於追求完美的奪勵標籤,而在於用計算資源自動從現實數據中提取隱性信號,最終讓代理在生產環境中自主學習、持續進化。”
完整解析
詳細威爾·布朗在本次演講中指出,強化學習面臨一個根本性困境:現實世界中的大多數智能代理任務——包括撰寫分析報告、預訂機票、處理退款、與用戶互動——都缺乏客觀定義的「正確答案」。傳統強化學習依靠明確的獎勵信號指導模型通過策略梯度優化自身,但當任務本身的邊界未定義、目標模糊時,這種清晰信號根本無法獲取。即便人工標注也極其耗時且不夠精準,尤其是對開放式、無限制的現實環境。
面對這個挑戰,講者提出了一套系統的替代方案,核心思想是「充分利用計算資源從現有數據中人工生成隱性獎勵信號」。第一層是基礎測試:通過 A/B 對比,揭示模型在擁有更多上下文時的性能差異,這個差異本身就構成了學習信號。第二層是利用 LLM 本身強大的推理能力——將模型當作通用「法官」,花費計算時間評估代理行為的好壞。第三層是從生產環境中挖掘原始軌跡數據:已部署系統的用戶提示、代理間的調用記錄、執行日誌等,這些數據雖然未標注但代表真實分布,隨著時間累積會形成分布先驗。第四層是反向工程思路:從文檔庫採樣、讓模型生成答案、驗證答案正確性,再丟棄初始問題,讓模型學會從答案反推任務——既获得了監督信號,又創造了符合實際的訓練任務。
強化學習的基礎設施則是高保真模擬器。Primordial 團隊發現,透過結合通用後端基礎設施、測試時計算擴展(test-time scaling)與搜索能力,可以構建生產環境的精密模擬。這些模擬器的獨特價值在於——可以實現真實環境無法實現的操作:直接種入答案、反向推導解決方案路徑、完全控制後端狀態以進行確定性驗證。模擬器質量不是一成不變的,而是可以通過不斷用生產軌跡改進、投入計算資源搜索複雜行為並讓代理學習改進實現,逐步提升保真度。在這過程中需要警惕「獎勵破解」現象——模型可能會找到滿足獎勵信號但實際不符合真實目的的解決方案。防控手段包括紅隊演練、對抗性提示優化、事後追蹤挖掘與多模型一致性檢驗。
最終願景是建立持續學習的閉環系統。已部署的代理在真實生產環境中執行任務時會犯錯,系統能自動觀察這些錯誤、生成對應的訓練任務、利用改進的模擬器進行強化學習,再部署更優的版本——整個過程形成自進化迴圈。人類專家的角色下沈至高層判斷層面(決定「這是好的還是壞的」),而非參與低層細節微調。Primordial 已通過發表的項目(如「通用代理」展示的線上循環架構)和與研究者合作的 Echo 項目(同時融合強化學習和監督學習信號以建立環境世界模型),逐步驗證這套方法的可行性。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


