如何提升强化学习的训练效率 | 吞吐量匹配的核心逻辑 | 缩放定律 | Rollout | GRPO | PipelineRL | Sandbox | 生成器 | 训练器 | RL环境 | 策略陈旧性
三句話摘要
大模型強化學習訓練系統的吞吐量匹配與效率優化方案。 強化學習訓練的真正瓶頸是系統工程而非演算法,生成端和訓練端的吞吐量匹配直接決定了投入GPU能否有效轉化為模型能力。 RL訓練系統的三層架構:生成器透過大模型推理產出輸出序列,RL環境(沙箱)根據結果給予獎勵分數,訓練器消費樣本進行參數更新並推送新權重給生成器。關鍵在於這三層的吞吐量是否匹配——若生成速度跟不上訓練,訓練器頻繁閒置;若生成速度超過訓練,佇列堆積導致樣本老化。
重點整理
重點- 1
RL訓練系統的三層架構:生成器透過大模型推理產出輸出序列,RL環境(沙箱)根據結果給予獎勵分數,訓練器消費樣本進行參數更新並推送新權重給生成器。關鍵在於這三層的吞吐量是否匹配——若生成速度跟不上訓練,訓練器頻繁閒置;若生成速度超過訓練,佇列堆積導致樣本老化。
- 2
GRPO演算法的訓練信號機制:同一提示詞採樣多個輸出,計算每個輸出相對組內平均值的優勢差值,優勢為正則強化,優勢為負則抑制。若組內獎勵分布均勻(任務過簡或過難),優勢全為零,該組樣本產生零訓練信號,導致算力浪費。
- 3
策略陳舊性與流水線權重更新:傳統同步訓練要等所有樣本生成完才更新,效率很低。流水線強化學習允許訓練器邊訓練邊推送新權重給生成器,但樣本可能由舊舊版本的策略生成,造成離策略(off-policy)訓練風險。必須設置陳舊性預算(如最多16步差距)來平衡效率與穩定性。
- 4
模型能力與行為的動態影響:模型的解決率、輸出長度、工具調用頻率會隨訓練持續變化,直接影響系統約束條件。長思維鏈回覆增加KV快取佔用、降低最大並發數;工具調用頻繁導致沙箱延遲上升;過簡單的課程設計讓獎勵分布均勻,訓練信號失效。系統必須動態適配才能維持效率。
實用技巧與重點
乾貨- 算法與框架
- GRPO(分組相對策略優化)是開源標準算法
- 流水線強化學習(Pipeline RL)引入異步權重更新機制
- 部分路線終止(Partial Trajectory)機制支持救援調隊
- 典型硬件配置(案例1:千問3 23.5B)
- 訓練端:64張H200 GPU,全分片數據並行 + 8路專家並行
- 生成端:192張 GPU,分24個推理副本,每副本1路數據並行 + 8路張量並行
- 批次大小512,每組16個路線,每批32個問題
- 典型硬件配置(案例2:GLM5)
- 訓練端:128張H200 GPU,全分片數據並行 + 2路上下文並行
- 生成端:128張H200,分2個64卡副本,32路數據並行 + 32路專家並行
- KV快取:1TB,最大序列長度64K
- 典型硬件配置(案例3:前沿3.2.3.5B)
- 訓練端:32-48張GPU漸進式擴展
- 生成端:24張GPU(固定)
- 並發路線:96-360(逐步增加)
- 效率指標
- 案例1:訓練器消費速率2.75樣本/秒,空轉30%,MFU僅10.5%
- 案例2:訓練器等待時間74%,消費速率為生成實際產出的5倍
- 案例1過採樣丟棄率:60%
- 案例2全通過率:55%(無訓練信號)
- 案例3樣本達上限率:3-8%
- 沙箱與工具
- 沙箱框架:Prime IL、OpenHouse、Model
- 容器類型:Firecracker輕量級到QEMU完整虛擬機
- 案例3並發數測試達906時出現初始化死鎖
- 案例4最慢沙箱啟動耗時:1小時
- 環境交互指標
- 案例1:平均回覆長度12K+,推理時間佔生成端道端延迟的絕大部分
- 案例2:模型行為飄移,平均回覆長度從24增至51,工具調用從24增至51次
- 案例3:單步最慢路線耗時7500秒,尾延迟極端
- 案例4:平均回覆12K,每序列12次工具調用
- 模型配置
- 精度:BF16或FP8
- 序列長度限制:32K-128K
- 最大策略陳舊性預算:16步
- 組大小:8-16個路線,任務難度高時調增至64
結論
結論“強化學習訓練的真正瓶頸是系統工程而非演算法,生成端和訓練端的吞吐量匹配直接決定了投入GPU能否有效轉化為模型能力。”
完整解析
詳細強化學習已成為激發大模型能力的核心引擎,尤其在編程代理領域,頭部廠商ARR合計已超300億美元。但與預訓練不同的是,RL訓練系統面臨著更複雜的工程挑戰。表面上看,RL訓練要求堆疊GPU來達成對數線性的性能提升,但實際瓶頸往往不在算法,而在於生成端和訓練端的吞吐量失配——許多團隊投入數百張GPU,最終訓練端算力利用率卻只有10%出頭。
RL訓練系統由三層角色組成。生成器透過大模型推理實時生成模型對提示詞的完整回覆,稱為路線(trajectory);RL環境(沙箱)根據路線內容給予獎勵信號,例如編程任務中執行生成的代碼並根據測試通過率評分;訓練器消費這些帶獎勵的樣本,執行參數更新後將新權重廣播回生成器,完成一個RL循環。系統效率的核心就是對列健康度——若生成速度跟不上訓練消費,訓練器頻繁空轉浪費算力;若生成速度超過訓練,佇列堆積導致樣本陳舊,形成離策略訓練的風險。
在算法層面,開源標準GRPO(分組相對策略優化)的邏輯是:針對同一提示詞採樣多個回覆,計算每個回覆的獎勵,然後衡量每個回覆相對組內平均值的優勢差值——優勢為正則強化,為負則抑制。但當任務過簡或過難時,組內所有回覆的獎勵相同,優勢皆為零,該組樣本會產生零訓練信號,等於白費生成成本。這是為什麼課程設計——即給模型呈現任務的難度順序——對RL訓練效率至關重要。
傳統的同步RL訓練要等所有樣本生成完才更新權重,導致訓練器和生成器必須相互等待,系統效率低下。流水線強化學習打破這一限制,允許訓練器邊執行訓練邊推送新權重給生成器,使兩端可以非同步運行。代價是生成的樣本可能由新舊不同版本的策略產生,即策略陳舊性。實驗表明RL演算法可在一定程度容忍陳舊性樣本,但超過預算(如最多16步版本差距)就會影響學習效果。流水線RL因此成為開源事實標準,體現了在陳舊性約束下的吞吐量匹配方案。
三層系統的吞吐量各受不同因素制約。訓練端的消費速率等於每批樣本數除以訓練不長。組大小、奪勵分布、優勢過濾等因素決定每批有效樣本數;而模型參數量、批次大小、並行策略等決定訓練耗時。生成端的生產速率等於並發路線數除以端道端延迟,後者由推理引擎配置、沙箱延遲、獎勵模型類型等決定。並發路線數主要受KV快取內存和平均序列長度限制——生成節點剩餘內存除以平均序列長度即最大並發數估算。
模型的能力和行為在訓練中持續飄移,直接改變系統約束。首先是解決率——模型解決任務的比例。當解決率接近0%或100%時,獎勵分布均勻,訓練信號失效。課程設計必須維持解決率在有意義的中間範圍(既不太簡單也不太難),才能提供足夠的優勢信號。其次是輸出行為。RL訓練激發思維鏈推理,導致模型輸出長度增加,佔用更多KV快取,最大並發路線數下降,生成延迟上升。最後是工具調用頻率。工具調用越頻繁,沙箱交互次數越多,端道端延迟越長,進一步壓低吞吐量。系統必須動態適配這些變化才能維持效率。
四個實驗案例充分驗證了理論邏輯。案例1展示長思維鏈回覆如何主導推理延遲,生成端採取過採樣策略(生成超額樣本後丟棄60%未完成或錯誤的)來緩解延迟方差,但代價是訓練器消費速率僅2.75樣本/秒、MFU只有10.5%。案例2則因課程過簡單導致55%的問題組獎勵均勻、訓練信號失效,訓練器有74%時間在等待。案例3在拉高並發路線數至900時遇到沙箱初始化死鎖,暴露了基礎設施的瓶頸。案例4引入部分路線終止機制救援調隊,但帶來了有狀態沙箱的複雜度——需要跨批次持久化狀態、動態建立沙箱、處理故障恢復,且恢復路線會面臨環境狀態級的陳舊性風險。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


