KeyFrame內部研究專用

The Messy Reality of Scale: Synthetic Data and Pre-Training — Marah Abdin & Robert McHardy, poolside

AI Engineer·7月26日週日英文

三句話摘要

Pulsar 團隊分享大型語言模型 Laguna 系列開發過程中,如何透過合成數據策略、訓練基礎設施優化和規模化檢測機制,解決模型擴展時遇到的數據與計算挑戰。 大規模語言模型的訓練成功取決於合成數據策略、數值精度管理和分散式系統監測的整體協調,並需要在實際大規模訓練中不斷發現與修復隱藏缺陷。 合成數據補充而非替代有機數據。有機數據中許多隱含特徵未以最優方式呈現,合成數據能萃取並投影到新維度,暴露隱含的邏輯、規劃和結構,同時填補數據缺口並規範化訓練過程。

重點整理

重點
  • 1

    合成數據補充而非替代有機數據。有機數據中許多隱含特徵未以最優方式呈現,合成數據能萃取並投影到新維度,暴露隱含的邏輯、規劃和結構,同時填補數據缺口並規範化訓練過程。

  • 2

    重述是解決高品質數據重複問題的核心方法。團隊實施通用多模式管道外,還針對程式碼和 STEM 數據建立專門化管道,選擇性地消除重複令牌,改善模型學習效率。

  • 3

    合成數據管道具有高度模組化設計,由種子、元數據、生成函數(智能體或 LLM)和補充函數組成,支援重述、多階段流程、跨域轉換、多輪迭代等多種組合方式,可應對從簡單到極複雜的生成任務。

  • 4

    大規模分散式訓練中存在難以察覺的系統性問題。破損 GPU 導致無聲資料損壞、張量並行累加的精度不足(BF16 → FP32)、FP8 訓練核心的競態條件(~0.5% 梯度無聲損壞),這些問題只有透過持續檢測和規模化測試才能發現。

實用技巧與重點

乾貨
  • 模型與訓練規模
  • Laguna 系列:M、M.1、XS.2、S(開發中)
  • Laguna S 參數量:1180 億總參數、80 億活躍參數
  • 訓練配置:30 兆令牌、4000 個 GPU
  • 合成數據
  • 預訓練混合佔比(XS.2):13%
  • 語料庫規模:6 兆令牌(持續增長)
  • 管道組件:種子、元數據、生成函數、補充函數(篩選器、驗證器)
  • 設計模式:重述、多階段流程、跨域轉移、多輪迭代、多智能體對話
  • 基礎設施
  • Hive:配置化代理隊列系統,支援進出時機配置、頻率控制、編排層、全局監督層
  • 檢測機制
  • 模型副本哈希校驗(分散式資料並行中驗證所有副本權重一致性)
  • 檢測到問題:破損 GPU、數值精度故障、競態條件
  • 數值精度問題
  • 問題 1:張量並行非嵌入層的 BF16 累加精度不足 → 改用 FP32 解決
  • 問題 2:FP8 訓練核心競態條件 → 約 0.5% 梯度被無聲取代
  • 評估基準表現
  • 編碼基準(Llama S 最優):Multiple Choice、HumanEval、Love Code Bench、Big Code Bench
  • 通用基準:Big Bench Hard、Eval Plus
  • 智能體效能代理:Speed Bench 多語言無代理性能
  • 比較對象:GLM 4.5 Air、M23 Super、DeepSeek V4 Flashmax、Nemotron

結論

結論

大規模語言模型的訓練成功取決於合成數據策略、數值精度管理和分散式系統監測的整體協調,並需要在實際大規模訓練中不斷發現與修復隱藏缺陷。

完整解析

詳細

Pulsar 團隊近期發佈了開源模型 Laguna 系列,並在 DEF CON 演講中分享了大型語言模型訓練中的關鍵發現。演講分為兩部分:Mar 聚焦合成數據策略,Robert 則講述訓練基礎設施與數值穩定性。

合成數據的策略轉變

團隊最初過度強調數據品質而忽視數量,導致在擴展模型訓練預算時遭遇高品質數據重複問題。模型因為接觸到過多重複令牌而過早飽和。為解決這個問題,他們採用了系統化的合成數據方案。重述(paraphrasing)成為主要工具,不僅使用通用多模式管道,還為程式碼-文本轉換和 STEM 領域設計了專門管道。在 Laguna XS.2 中,合成數據佔預訓練混合的 13%,整體語料庫已達 6 兆令牌且持續擴展。

合成數據管道的設計採用模組化架構,由六個核心組件組成:種子(原始輸入)、元數據、生成函數(可以是裝備工具的智能體或帶提示範本的 LLM)、以及補充函數如篩選器與驗證器。這種設計支援多種組合方式,從簡單的重述到複雜的多階段工作流。複雜任務被拆解為更簡單的子任務,讓模型能保持正確性與多樣性。為管理這些管道,團隊開發了 Hive 基礎設施,允許配置智能體隊列、進出時機、頻率等參數,並透過編排層提供層級結構與動態指令調整。

訓練規模下的隱藏問題

Robert 強調,優質的數據和優質的訓練代碼必須整體協調——任何一方失敗都會導致模型訓練失敗。為此團隊採用了模型副本哈希校驗機制。在分散式資料並行訓練中,所有模型副本的權重應保持相同,計算權重哈希值應該一致。若發現不一致,表示訓練出現嚴重問題。

在實際訓練中發現了多個非預期問題。首先是破損的 GPU 導致無聲資料損壞,表現為損失曲線異常波動與梯度規範異常增長。其次是一個更隱蔽的數值精度問題:非嵌入層的張量並行累加預設採用 BF16 精度,當激活值持續增長時,精度不足導致模型無法收斂。將累加改為 FP32 後,模型從第 50,000 步後恢復收斂。這些發現全部被整合到 M.1 升級至 XS.2 的迭代中。

Laguna S 與新的擴展挑戰

為驗證這些改進在真正大規模下是否可行,團隊開發了 Laguna S(1180 億總參數,80 億活躍參數),在 4000 個 GPU 上訓練 30 兆令牌。這個規模足以測試改進是否持久,以及是否出現新的問題。確實又發現了一個新問題:FP8 訓練核心中的競態條件導致約 0.5% 的梯度被無聲地損壞。有趣的是,副本哈希校驗無法捕捉這個問題,因為實際訓練沒有冗餘的權重副本可比較。團隊正開發新的校驗機制來填補這個盲點。

從初步評估看,Laguna S 在程式碼相關基準上表現優異,超越 XS.2、M.1 以及 GLM 4.5 Air、DeepSeek V4 FlashMax 等競品,在多語言無代理性能代理上表現尤其突出,驗證了數據與訓練改進的有效性。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。