DeepSeek's New Trick Makes LLMs 85% Faster
三句話摘要
DeepSeq 發布的 DS PARC 推測解碼技術如何在不重新訓練模型的前提下實現 50-400% 的推理加速。 推測解碼通過輕量級草稿模型與智能驗證策略,在不改動模型權重的前提下實現 50-400% 推理加速,是生產級推理優化的高性價比方案。 解決解碼階段的內存瓶頸。傳統語言模型逐次生成令牌導致 GPU 等待成為主要開銷;DS PARC 讓小型模型在單次前向傳遞中猜測多個令牌,大型模型也在一次前向傳遞中驗證整個塊,大幅減少前向傳遞次數。
重點整理
重點- 1
解決解碼階段的內存瓶頸。傳統語言模型逐次生成令牌導致 GPU 等待成為主要開銷;DS PARC 讓小型模型在單次前向傳遞中猜測多個令牌,大型模型也在一次前向傳遞中驗證整個塊,大幅減少前向傳遞次數。
- 2
半自迴歸設計克服先前方法的兩大問題。自迴歸模型(如 Eagle 3)精確但速度慢,並行模型(如 Dragonfly Flash)雖快但存在"尾部漂移"——後續令牌相互忽視導致錯誤率升高;DS PARC 加入輕量級串行頭讓各令牌能看到前驅令牌,既保持並行效率又消除漂移,接受長度比 Eagle 3 增加 30%、比 Dragonfly Flash 增加 16-18%。
- 3
置信度調度驗證針對生產環境優化。系統評估每個令牌的存活概率,伺服器負載輕時驗證整個塊,負載重時僅驗證高置信度前綴,避免浪費計算資源在必然被拒絕的令牌上。
- 4
完全開源的模型無關插件。DS PARC 是可附加到任何模型架構的輕量級頭,無需修改原始模型,已驗證支持 Qwen 和 Gemma 等開源模型,降低部署門檻。
實用技巧與重點
乾貨- 推理加速幅度:50-400%(不需重新訓練或量化)
- 生產環保境改善:令牌延遲降低 57-85%(相同總吞吐量下)
- 塊長度增長:比 Eagle 3 提升約 30%;比 Dragonfly Flash 提升 16-18%
- 支持的模型:Claude Opus Flash、Claude Opus Pro、Qwen、Gemma
- 關鍵公式:單位令牌時間 = (草稿時間 + 驗證時間) / 每輪接受的令牌數
- 可優化的三個維度:(1) 降低草稿模型延遲;(2) 提高草稿品質以增加單輪接受數;(3) 減少驗證時間
- 開源代碼庫:DeepSpecs(包含訓練代碼和草稿模型檢查點)
- 先前方法的局限:自迴歸模型(Eagle 3)、並行模型(Dragonfly Flash)的尾部漂移問題
結論
結論“推測解碼通過輕量級草稿模型與智能驗證策略,在不改動模型權重的前提下實現 50-400% 推理加速,是生產級推理優化的高性價比方案。”
完整解析
詳細大型語言模型的推理過程長期面臨效能瓶頸。傳統方式下模型逐次生成令牌——稱為"下一個令牌預測器"——生成六個令牌的句子需要六次前向傳遞。這導致延遲隨生成長度線性增長。更關鍵的問題在於解碼階段本質上是內存受限的:GPU 主要耗時在等待下一個令牌生成,即使面對長序列也無法充分利用計算能力。
DeepSeq 的 DS PARC 技術通過引入小型快速草稿模型來根本性解決此問題。基本原理是:小型模型在單次前向傳遞中猜測多個令牌塊(如六個令牌),隨後大型目標模型也在單次前向傳遞中驗證整個塊。若所有令牌都被驗證正確就全部保留;若某位置出錯,模型保留正確前綴後停止,由大型模型補充該位置。最終輸出與單獨使用大型模型完全相同,實現了無損加速。單位令牌的處理時間受三個因素影響:草稿時間、驗證時間與單輪接受的令牌數。優化空間包括選擇更快的草稿模型、提高草稿品質以增加單輪接受數、減少驗證開銷。
先前的推測解碼方法存在關鍵局限。自迴歸草稿模型(如 Eagle 3)須逐次處理令牌導致速度慢且易卡在小塊;並行草稿模型(如 Dragonfly Flash)雖然快速但會產生"尾部漂移"——後續位置的令牌相互忽視導致錯誤率升高。DS PARC 的創新在於採用"半自迴歸"設計:保持重型草稿主幹的完全並行特性以維持速度,但在其上疊加輕量級串行頭,讓每個令牌能觀察其前驅令牌。這直接解決尾部漂移問題,使 DS PARC 能接受比 Eagle 3 長 30% 的塊、比 Dragonfly Flash 長 16-18% 的塊。
為適應生產環境需求,DS PARC 加入置信度評分機制,預測哪些令牌會被驗證通過。系統根據伺服器負載動態調整:負載輕時驗證整個塊,負載重時僅驗證高置信度前綴,剩餘令牌跳過。這確保計算資源優先分配給真實用戶請求。DS PARC 並非單純研究論文,已在 Claude Opus Flash 和 Claude Opus Pro 的生產系統中部署。實測數據顯示在相同總吞吐量下,用戶獲取單個令牌的延遲降低 57-85%,且無需額外硬體投入。技術完全開源發布,以輕量級插件頭的形式實現,可無縫附加到任何模型架構而無需修改原始結構,已驗證支持 Qwen 和 Gemma 等開源模型。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


