KeyFrame內部研究專用

DeepSeek让LLM推理吞吐提升51%以上!拆解DSpark投机解码技术

Why QQ·6月28日週日·13 min中文

三句話摘要

DeepSeek 開源 DeepSpark 投機解碼技術,透過半字回歸生成與動態調度機制,在不改變模型結構前提下將大模型推理吞吐量提升 50% 以上。 DeepSpark 揭示了 AI 系統設計的新方向——從盲目堆砌算力走向智能調度與概率預測,一個精妙的調度器可能比多買幾塊 GPU 效果還好。 雙層架構突破傳統困局:DeepSpark 融合並行小弟(Deflash)的速度與自回歸小弟的準確率。通過並行主幹快速生成基礎 Logits,再用低秩矩陣分解的轉移偏差逐詞校準,在保持生成速度的同時大幅提升草稿準確度。

重點整理

重點
  • 1

    雙層架構突破傳統困局:DeepSpark 融合並行小弟(Deflash)的速度與自回歸小弟的準確率。通過並行主幹快速生成基礎 Logits,再用低秩矩陣分解的轉移偏差逐詞校準,在保持生成速度的同時大幅提升草稿準確度。

  • 2

    概率預測驅動的智能調度:系統用線性投影加 Sigmoid 估計每個詞被接受的概率,並通過順序溫度縮放校準預測,使質心度投預測能給出可靠估計。硬件感知的調度器根據系統容量曲線動態決定驗證長度,實現真正的「用在刀刃上」。

  • 3

    生產環境的工程智慧:三大核心挑戰——硬件容量曲線離散化、變長驗證與快取兼容性、訓練效率——都有對應方案。兩步延遲調度避免管道停頓,展屏處理 Token 實現無縫動態路由,隱藏狀態通信節省訓練開銷。

  • 4

    通用框架超越特定優化:DeepSpark 不改變原模型檢查點,只需推理引擎配合,已在 DeepSeek V4 Flash/Pro 與 Gemma4 驗證,具有跨模型家族的遷移潛力。

實用技巧與重點

乾貨
  • 核心指標
  • 草稿準確度:AcceptedLens 提升至 4.73 詞(vs Deflash 4.06,提升 16.3%;vs Ego3,提升 30.9%)
  • 推理吞吐:V4 Flash 中等交互性 SLA 下提升 51%,V4 Pro 提升 52%
  • 單用戶延遲:匹配系統容量下生成速度提升 60-85%(Flash)、57-78%(Pro)
  • 技術元件
  • 半字回歸:並行主幹(Deflash)+ 輕量級順序模組(低秩矩陣分解,R=256/512)
  • 質心度投:線性投影 + Sigmoid + 順序溫度縮放
  • 硬件感知調度器:計算前坠生存概率、動態容量預估、吞吐最優化決策
  • 訓練配置
  • 三項損失函數:交叉熵損失(草稿預測)、分佈匹配損失(最小化總變差距離)、質心度損失(驗證預測)
  • 損失加權:指數位置權重,強調序列早期位置
  • 動態調度範例
  • V4 Flash:並發 <200 分配 4-6 詞驗證預算;並發增加自動縮小預算
  • V4 Pro:並發 <150 類似預算分配
  • 模型支援
  • DeepSeek V4 Flash 與 Pro 的 DeepSpark 檢查點已在 HuggingFace 發布
  • DeepSpark/Deflash/Ego3 的訓練評估框架開源在 GitHub

結論

結論

DeepSpark 揭示了 AI 系統設計的新方向——從盲目堆砌算力走向智能調度與概率預測,一個精妙的調度器可能比多買幾塊 GPU 效果還好。

完整解析

詳細

大模型推理性能的核心瓶頸一直是自回歸生成的串行特性。傳統方式下,系統一次只能生成一個詞,每生成一個詞都需要一次完整的前向傳播,導致 GPU 大部分時間在等待內存搬運數據而非執行計算。這個問題的根本原因是自回歸的順序依賴性——後一個詞的生成必須等待前一個詞確定後才能進行。

投機解碼技術試圖打破這一瓶頸,其核心思路是使用一個小型快速的「草稿模型」先大膽地預測多個詞,再由大型目標模型一次性驗證這些預測。這樣就把串行計算轉變為並行驗證。然而傳統投機解碼面臨一個兩難困境:自回歸小弟模型預測準確但生成速度慢(因為每個詞都需要獨立計算),而並行小弟(如 Deflash)雖然速度快得多但因為詞與詞間缺乏上下文聯繫導致預測準確度大幅下降。

DeepSpark 的創新在於引入「半字回歸生成」機制,巧妙地融合兩者優勢。系統採用一個並行主幹網路(基於 Deflash 架構)快速生成所有基礎 Logits,然後在其後接入一個輕量級的順序模組。這個順序模組的關鍵是一個低秩矩陣分解的轉移偏差——它基於前一個詞計算一個修正項,為當前詞的預測注入上下文依賴性。透過將 V×V 矩陣(V 為詞表大小,通常 10 萬維量級)分解為兩個小矩陣(R 維為 256 或 512),計算複雜度從 O(V²) 大幅降低到 O(R×V)。實驗結果顯示,在困 3 模型上,平均可接受詞數從 4.06 提升至 4.73,相比 Deflash 提升 16.3%,相比另一基準 Ego3 提升 30.9%。

然而即便草稿質量提升,系統仍需應對另一核心問題:在高並發場景下,驗證那些注定會被拒絕的低質預測會白白浪費計算資源。DeepSpark 的第二個創新是「質心度調度驗證」。系統透過一個輕量級的線性投影模組,基於並行主幹的隱藏狀態和前一詞的信息,預測當前詞被目標模型接受的概率。由於這些概率估計往往過於樂觀,系統引入順序溫度縮放技術,在生成序列的不同位置動態調整溫度參數,使預測概率與實際接受率相匹配。進一步地,硬件感知的調度器計算所有候選詞的「前坠生存概率」(前 K 個詞都被接受的累積概率),按概率從高到低逐詞加入驗證堆列。每次添加時系統會重新估計預期吞吐量(基於預先測量的容量曲線),當吞吐開始下降時停止,找到最優的驗證長度。這種動態調度在低並發時可分配 4-6 詞預算,並發增加時自動縮小,實現真正的負載自適應。

生產環境中的實現則面臨諸多工程挑戰。實際硬件容量曲線並非理論上的光滑曲線,而是因快取行為和記憶體訪問模式產生的離散「鋸齒狀」,充滿效能懸崖。DeepSpark 採用兩步延遲調度方案,用前兩步的質心度預測估計當前步容量,避免 GPU 管道停頓。變長驗證會導致 GPU 核心計算利用率下降,因此系統對所有 Token 進行展屏處理,透過標記張量傳遞序列依賴,只在 Index Attention 和 Compress Kernels 層級修改以支持變長路由。訓練效率方面,直接計算所有位置的目標模型分佈會產生巨大開銷,DeepSpark 改為傳輸低維隱藏狀態而非完整 Logits,並採用毛點接定的序列打包策略。

實測結果驚人:在 V4 Flash 上,中等交互性延遲約束下吞吐量提升 51%,嚴格高互動 SLA 下名義倍數達 661%(但主要反映交互邊界外推而非常規加速)。匹配系統容量下單用戶生成速度提升 60-85%。V4 Pro 結果類似,中等 SLA 下吞吐提升 52%,嚴格 SLA 下名義倍數 406%,單用戶速度提升 57-78%。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。