KeyFrame內部研究專用

如何提升强化学习的训练效率 | 吞吐量匹配的核心逻辑 | 缩放定律 | Rollout | GRPO | PipelineRL | Sandbox | 生成器 | 训练器 | RL环境 | 策略陈旧性

Best Partners TV·6月29日週一·22 min中文

三句話摘要

大模型強化學習訓練系統的吞吐量匹配與效率優化方案。 強化學習訓練的真正瓶頸是系統工程而非演算法,生成端和訓練端的吞吐量匹配直接決定了投入GPU能否有效轉化為模型能力。 RL訓練系統的三層架構:生成器透過大模型推理產出輸出序列,RL環境(沙箱)根據結果給予獎勵分數,訓練器消費樣本進行參數更新並推送新權重給生成器。關鍵在於這三層的吞吐量是否匹配——若生成速度跟不上訓練,訓練器頻繁閒置;若生成速度超過訓練,佇列堆積導致樣本老化。

重點整理

重點
  • 1

    RL訓練系統的三層架構:生成器透過大模型推理產出輸出序列,RL環境(沙箱)根據結果給予獎勵分數,訓練器消費樣本進行參數更新並推送新權重給生成器。關鍵在於這三層的吞吐量是否匹配——若生成速度跟不上訓練,訓練器頻繁閒置;若生成速度超過訓練,佇列堆積導致樣本老化。

  • 2

    GRPO演算法的訓練信號機制:同一提示詞採樣多個輸出,計算每個輸出相對組內平均值的優勢差值,優勢為正則強化,優勢為負則抑制。若組內獎勵分布均勻(任務過簡或過難),優勢全為零,該組樣本產生零訓練信號,導致算力浪費。

  • 3

    策略陳舊性與流水線權重更新:傳統同步訓練要等所有樣本生成完才更新,效率很低。流水線強化學習允許訓練器邊訓練邊推送新權重給生成器,但樣本可能由舊舊版本的策略生成,造成離策略(off-policy)訓練風險。必須設置陳舊性預算(如最多16步差距)來平衡效率與穩定性。

  • 4

    模型能力與行為的動態影響:模型的解決率、輸出長度、工具調用頻率會隨訓練持續變化,直接影響系統約束條件。長思維鏈回覆增加KV快取佔用、降低最大並發數;工具調用頻繁導致沙箱延遲上升;過簡單的課程設計讓獎勵分布均勻,訓練信號失效。系統必須動態適配才能維持效率。

實用技巧與重點

乾貨
  • 算法與框架
  • GRPO(分組相對策略優化)是開源標準算法
  • 流水線強化學習(Pipeline RL)引入異步權重更新機制
  • 部分路線終止(Partial Trajectory)機制支持救援調隊
  • 典型硬件配置(案例1:千問3 23.5B)
  • 訓練端:64張H200 GPU,全分片數據並行 + 8路專家並行
  • 生成端:192張 GPU,分24個推理副本,每副本1路數據並行 + 8路張量並行
  • 批次大小512,每組16個路線,每批32個問題
  • 典型硬件配置(案例2:GLM5)
  • 訓練端:128張H200 GPU,全分片數據並行 + 2路上下文並行
  • 生成端:128張H200,分2個64卡副本,32路數據並行 + 32路專家並行
  • KV快取:1TB,最大序列長度64K
  • 典型硬件配置(案例3:前沿3.2.3.5B)
  • 訓練端:32-48張GPU漸進式擴展
  • 生成端:24張GPU(固定)
  • 並發路線:96-360(逐步增加)
  • 效率指標
  • 案例1:訓練器消費速率2.75樣本/秒,空轉30%,MFU僅10.5%
  • 案例2:訓練器等待時間74%,消費速率為生成實際產出的5倍
  • 案例1過採樣丟棄率:60%
  • 案例2全通過率:55%(無訓練信號)
  • 案例3樣本達上限率:3-8%
  • 沙箱與工具
  • 沙箱框架:Prime IL、OpenHouse、Model
  • 容器類型:Firecracker輕量級到QEMU完整虛擬機
  • 案例3並發數測試達906時出現初始化死鎖
  • 案例4最慢沙箱啟動耗時:1小時
  • 環境交互指標
  • 案例1:平均回覆長度12K+,推理時間佔生成端道端延迟的絕大部分
  • 案例2:模型行為飄移,平均回覆長度從24增至51,工具調用從24增至51次
  • 案例3:單步最慢路線耗時7500秒,尾延迟極端
  • 案例4:平均回覆12K,每序列12次工具調用
  • 模型配置
  • 精度:BF16或FP8
  • 序列長度限制:32K-128K
  • 最大策略陳舊性預算:16步
  • 組大小:8-16個路線,任務難度高時調增至64

結論

結論

強化學習訓練的真正瓶頸是系統工程而非演算法,生成端和訓練端的吞吐量匹配直接決定了投入GPU能否有效轉化為模型能力。

完整解析

詳細

強化學習已成為激發大模型能力的核心引擎,尤其在編程代理領域,頭部廠商ARR合計已超300億美元。但與預訓練不同的是,RL訓練系統面臨著更複雜的工程挑戰。表面上看,RL訓練要求堆疊GPU來達成對數線性的性能提升,但實際瓶頸往往不在算法,而在於生成端和訓練端的吞吐量失配——許多團隊投入數百張GPU,最終訓練端算力利用率卻只有10%出頭。

RL訓練系統由三層角色組成。生成器透過大模型推理實時生成模型對提示詞的完整回覆,稱為路線(trajectory);RL環境(沙箱)根據路線內容給予獎勵信號,例如編程任務中執行生成的代碼並根據測試通過率評分;訓練器消費這些帶獎勵的樣本,執行參數更新後將新權重廣播回生成器,完成一個RL循環。系統效率的核心就是對列健康度——若生成速度跟不上訓練消費,訓練器頻繁空轉浪費算力;若生成速度超過訓練,佇列堆積導致樣本陳舊,形成離策略訓練的風險。

在算法層面,開源標準GRPO(分組相對策略優化)的邏輯是:針對同一提示詞採樣多個回覆,計算每個回覆的獎勵,然後衡量每個回覆相對組內平均值的優勢差值——優勢為正則強化,為負則抑制。但當任務過簡或過難時,組內所有回覆的獎勵相同,優勢皆為零,該組樣本會產生零訓練信號,等於白費生成成本。這是為什麼課程設計——即給模型呈現任務的難度順序——對RL訓練效率至關重要。

傳統的同步RL訓練要等所有樣本生成完才更新權重,導致訓練器和生成器必須相互等待,系統效率低下。流水線強化學習打破這一限制,允許訓練器邊執行訓練邊推送新權重給生成器,使兩端可以非同步運行。代價是生成的樣本可能由新舊不同版本的策略產生,即策略陳舊性。實驗表明RL演算法可在一定程度容忍陳舊性樣本,但超過預算(如最多16步版本差距)就會影響學習效果。流水線RL因此成為開源事實標準,體現了在陳舊性約束下的吞吐量匹配方案。

三層系統的吞吐量各受不同因素制約。訓練端的消費速率等於每批樣本數除以訓練不長。組大小、奪勵分布、優勢過濾等因素決定每批有效樣本數;而模型參數量、批次大小、並行策略等決定訓練耗時。生成端的生產速率等於並發路線數除以端道端延迟,後者由推理引擎配置、沙箱延遲、獎勵模型類型等決定。並發路線數主要受KV快取內存和平均序列長度限制——生成節點剩餘內存除以平均序列長度即最大並發數估算。

模型的能力和行為在訓練中持續飄移,直接改變系統約束。首先是解決率——模型解決任務的比例。當解決率接近0%或100%時,獎勵分布均勻,訓練信號失效。課程設計必須維持解決率在有意義的中間範圍(既不太簡單也不太難),才能提供足夠的優勢信號。其次是輸出行為。RL訓練激發思維鏈推理,導致模型輸出長度增加,佔用更多KV快取,最大並發路線數下降,生成延迟上升。最後是工具調用頻率。工具調用越頻繁,沙箱交互次數越多,端道端延迟越長,進一步壓低吞吐量。系統必須動態適配這些變化才能維持效率。

四個實驗案例充分驗證了理論邏輯。案例1展示長思維鏈回覆如何主導推理延遲,生成端採取過採樣策略(生成超額樣本後丟棄60%未完成或錯誤的)來緩解延迟方差,但代價是訓練器消費速率僅2.75樣本/秒、MFU只有10.5%。案例2則因課程過簡單導致55%的問題組獎勵均勻、訓練信號失效,訓練器有74%時間在等待。案例3在拉高並發路線數至900時遇到沙箱初始化死鎖,暴露了基礎設施的瓶頸。案例4引入部分路線終止機制救援調隊,但帶來了有狀態沙箱的複雜度——需要跨批次持久化狀態、動態建立沙箱、處理故障恢復,且恢復路線會面臨環境狀態級的陳舊性風險。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。