KeyFrame內部研究專用

推测解码方案DSpark | DeepSeek | DeepSpec开源 | 自回归生成 | 草稿模型 | 半自回归生成 | 置信度调度验证 | 零开销调度 | CUDA图回放 | 大模型推理加速

Best Partners TV·6月30日週二·22 min中文

三句話摘要

DeepSeek V4 Pro 通過 DeepSpark 推測解碼技術實現推理加速,將 AI 模型服務的吞吐量和延遲矛盾解決。 推測解碼的下一步突破不再是單點算法創新,而是系統級的架構設計與硬體協同,DeepSpark 用半自回歸 + 動態調度示範了這條路。 推測解碼的工程化突破:傳統推理每生成一個 token 需要完整前向傳播,延遲與長度正相關。DeepSpark 用小模型快速生成多個候選 token,讓大模型一次批量驗證,把串行轉為批處理,根本上改善了延遲與吞吐的矛盾。

重點整理

重點
  • 1

    推測解碼的工程化突破:傳統推理每生成一個 token 需要完整前向傳播,延遲與長度正相關。DeepSpark 用小模型快速生成多個候選 token,讓大模型一次批量驗證,把串行轉為批處理,根本上改善了延遲與吞吐的矛盾。

  • 2

    半自回歸架構的權衡設計:單純的並行模型速度快但後期 token 接受率快速衰減(浪費驗證算力),單純的自回歸模型準確但生成慢。DeepSpark 用並行骨幹負責速度,輕量級順序頭注入依賴關係修正衰減,兩層 DeepSpark 的效果已超過五層純並行模型。

  • 3

    質信度預測與動態調度:不是固定長度的驗證候選,而是對每個 token 預測存活概率,結合當前硬體吞吐能力動態決定驗證長度。系統邊運行邊校準預測值,高並發時自動收緊、閒時放開,真正實現自適應。

  • 4

    系統級工程優化的價值:從模型架構、訓練損失權重、GPU 內核優化、零開銷調度到溫度缩放校準,每個環節都做了細緻設計。這不是單點算法創新,而是算法、調度、硬體的三維協同,才能在生產環境真正跑通。

實用技巧與重點

乾貨
  • 性能數據:
  • 對比 eGo3(自回歸草稿):平均接受長度提升 26.7%-30.9%
  • 對比 Deflash(純並行草稿):提升 16.3%-18.4%
  • 對比之前的 MTP1 方案:單用戶生成速度快 60%-85%(Flash 版本)、57%-78%(Pro 版本)
  • 中等交互速度要求下,總吞吐提升約 50%
  • 質信度校準誤差從 3%-8% 壓到約 1%
  • 技術組件:
  • 草稿塊長度從 4 擴到 16,額外延遲只增加 0.2%-1.3%
  • 默認 4B 配置存儲需求:38TB
  • 馬爾可夫頭(默認)vs RNN 頭(可選)
  • 顺序温度缩放用於概率校準
  • 開源工具鏈(DeepSeek 框架):
  • 包含數據準備、訓練、評估三個階段
  • 內置 DeepSpark、DeepFlash、eGo 三種草稿演算法
  • 支持 Qwen 和 Llama 系列目標模型

結論

結論

推測解碼的下一步突破不再是單點算法創新,而是系統級的架構設計與硬體協同,DeepSpark 用半自回歸 + 動態調度示範了這條路。

完整解析

詳細

DeepSeek V4 Pro 的推理瓶頸在於自回歸生成的天然限制:每生成一個 token 都需要一次完整的 GPU 前向傳播,導致延遲與輸出長度成正比。雖然 GPU 可以同時處理 10 個 token 的成本只比 1 個 token 略高(顯存搬運成本是主要開銷,而非計算),但串行的 token 依賴關係無法直接並行。推測解碼通過引入草稿模型打破了這個瓶頸:先用小模型快速猜測候選序列,再讓大模型用拒絕採樣規則一次驗證完,理論上輸出分布完全一致。

之前的推測解碼方案陷入兩難:自回歸草稿模型(如 eGo3、MTP)準確但慢,無法生成足夠長的候選;並行草稿模型(Deflash)快但不準,後期 token 的接受率快速衰減。DeepSpark 的創新在於半自回歸設計,第一步用並行骨幹網路一次輸出所有候選位置的基礎 logits(保證速度),第二步用輕量級的馬爾可夫頭從前往後逐位置注入前序依賴修正(保證準確)。實測顯示,2 層 DeepSpark 已能超過 5 層純並行模型,參數效率大幅提升。

更關鍵的是質信度預測與硬體感知調度層。系統對每個 token 預測其通過驗證的條件概率,同時預測當前硬體在不同批次大小下的實際吞吐。調度器根據 Pareto 最優原理動態決定每個請求的驗證長度:不再是固定猜 N 個 token,而是邊加邊算,只要預期總吞吐還在上升就繼續加候選,一旦開始下降就停止。為了避免泄露未來信息破壞無損性,工程上採用了兩步預測決策法:用歷史質信度信息決定當前截斷長度,分離了調度決策與當前 token 生成。系統運行時還會自動校準質信度預測值,高並發時收緊預值確保吞吐穩定,閒時放開以最大化用戶速度。

整套方案的工程細節繁複但必要:訓練時平衡三個損失函數(交叉熵、分布匹配、質信度),位置權重設計使前序 token 優化力度更大;推理時優化 GPU 內核支持動態變長路由,實現零開銷調度且不中斷流水線;通訊時只傳遞隱藏狀態而非完整詞表 logits 以緩解頻寬。這些看似細微的決策,在高並發生產環境中決定了系統能否真正部署成功。DeepSeek 同時開源了完整的 DeepSeek 框架,內置三種草稿演算法和標準工具鏈,大幅降低了後來者的開發門檻。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。