The Messy Reality of Scale: Synthetic Data and Pre-Training — Marah Abdin & Robert McHardy, poolside
三句話摘要
Pulsar 團隊分享大型語言模型 Laguna 系列開發過程中,如何透過合成數據策略、訓練基礎設施優化和規模化檢測機制,解決模型擴展時遇到的數據與計算挑戰。 大規模語言模型的訓練成功取決於合成數據策略、數值精度管理和分散式系統監測的整體協調,並需要在實際大規模訓練中不斷發現與修復隱藏缺陷。 合成數據補充而非替代有機數據。有機數據中許多隱含特徵未以最優方式呈現,合成數據能萃取並投影到新維度,暴露隱含的邏輯、規劃和結構,同時填補數據缺口並規範化訓練過程。
重點整理
重點- 1
合成數據補充而非替代有機數據。有機數據中許多隱含特徵未以最優方式呈現,合成數據能萃取並投影到新維度,暴露隱含的邏輯、規劃和結構,同時填補數據缺口並規範化訓練過程。
- 2
重述是解決高品質數據重複問題的核心方法。團隊實施通用多模式管道外,還針對程式碼和 STEM 數據建立專門化管道,選擇性地消除重複令牌,改善模型學習效率。
- 3
合成數據管道具有高度模組化設計,由種子、元數據、生成函數(智能體或 LLM)和補充函數組成,支援重述、多階段流程、跨域轉換、多輪迭代等多種組合方式,可應對從簡單到極複雜的生成任務。
- 4
大規模分散式訓練中存在難以察覺的系統性問題。破損 GPU 導致無聲資料損壞、張量並行累加的精度不足(BF16 → FP32)、FP8 訓練核心的競態條件(~0.5% 梯度無聲損壞),這些問題只有透過持續檢測和規模化測試才能發現。
實用技巧與重點
乾貨- 模型與訓練規模
- Laguna 系列:M、M.1、XS.2、S(開發中)
- Laguna S 參數量:1180 億總參數、80 億活躍參數
- 訓練配置:30 兆令牌、4000 個 GPU
- 合成數據
- 預訓練混合佔比(XS.2):13%
- 語料庫規模:6 兆令牌(持續增長)
- 管道組件:種子、元數據、生成函數、補充函數(篩選器、驗證器)
- 設計模式:重述、多階段流程、跨域轉移、多輪迭代、多智能體對話
- 基礎設施
- Hive:配置化代理隊列系統,支援進出時機配置、頻率控制、編排層、全局監督層
- 檢測機制
- 模型副本哈希校驗(分散式資料並行中驗證所有副本權重一致性)
- 檢測到問題:破損 GPU、數值精度故障、競態條件
- 數值精度問題
- 問題 1:張量並行非嵌入層的 BF16 累加精度不足 → 改用 FP32 解決
- 問題 2:FP8 訓練核心競態條件 → 約 0.5% 梯度被無聲取代
- 評估基準表現
- 編碼基準(Llama S 最優):Multiple Choice、HumanEval、Love Code Bench、Big Code Bench
- 通用基準:Big Bench Hard、Eval Plus
- 智能體效能代理:Speed Bench 多語言無代理性能
- 比較對象:GLM 4.5 Air、M23 Super、DeepSeek V4 Flashmax、Nemotron
結論
結論“大規模語言模型的訓練成功取決於合成數據策略、數值精度管理和分散式系統監測的整體協調,並需要在實際大規模訓練中不斷發現與修復隱藏缺陷。”
完整解析
詳細Pulsar 團隊近期發佈了開源模型 Laguna 系列,並在 DEF CON 演講中分享了大型語言模型訓練中的關鍵發現。演講分為兩部分:Mar 聚焦合成數據策略,Robert 則講述訓練基礎設施與數值穩定性。
合成數據的策略轉變
團隊最初過度強調數據品質而忽視數量,導致在擴展模型訓練預算時遭遇高品質數據重複問題。模型因為接觸到過多重複令牌而過早飽和。為解決這個問題,他們採用了系統化的合成數據方案。重述(paraphrasing)成為主要工具,不僅使用通用多模式管道,還為程式碼-文本轉換和 STEM 領域設計了專門管道。在 Laguna XS.2 中,合成數據佔預訓練混合的 13%,整體語料庫已達 6 兆令牌且持續擴展。
合成數據管道的設計採用模組化架構,由六個核心組件組成:種子(原始輸入)、元數據、生成函數(可以是裝備工具的智能體或帶提示範本的 LLM)、以及補充函數如篩選器與驗證器。這種設計支援多種組合方式,從簡單的重述到複雜的多階段工作流。複雜任務被拆解為更簡單的子任務,讓模型能保持正確性與多樣性。為管理這些管道,團隊開發了 Hive 基礎設施,允許配置智能體隊列、進出時機、頻率等參數,並透過編排層提供層級結構與動態指令調整。
訓練規模下的隱藏問題
Robert 強調,優質的數據和優質的訓練代碼必須整體協調——任何一方失敗都會導致模型訓練失敗。為此團隊採用了模型副本哈希校驗機制。在分散式資料並行訓練中,所有模型副本的權重應保持相同,計算權重哈希值應該一致。若發現不一致,表示訓練出現嚴重問題。
在實際訓練中發現了多個非預期問題。首先是破損的 GPU 導致無聲資料損壞,表現為損失曲線異常波動與梯度規範異常增長。其次是一個更隱蔽的數值精度問題:非嵌入層的張量並行累加預設採用 BF16 精度,當激活值持續增長時,精度不足導致模型無法收斂。將累加改為 FP32 後,模型從第 50,000 步後恢復收斂。這些發現全部被整合到 M.1 升級至 XS.2 的迭代中。
Laguna S 與新的擴展挑戰
為驗證這些改進在真正大規模下是否可行,團隊開發了 Laguna S(1180 億總參數,80 億活躍參數),在 4000 個 GPU 上訓練 30 兆令牌。這個規模足以測試改進是否持久,以及是否出現新的問題。確實又發現了一個新問題:FP8 訓練核心中的競態條件導致約 0.5% 的梯度被無聲地損壞。有趣的是,副本哈希校驗無法捕捉這個問題,因為實際訓練沒有冗餘的權重副本可比較。團隊正開發新的校驗機制來填補這個盲點。
從初步評估看,Laguna S 在程式碼相關基準上表現優異,超越 XS.2、M.1 以及 GLM 4.5 Air、DeepSeek V4 FlashMax 等競品,在多語言無代理性能代理上表現尤其突出,驗證了數據與訓練改進的有效性。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


