KeyFrame內部研究專用

DeepSeek's New Trick Makes LLMs 85% Faster

Prompt Engineering·6月28日週日·11 min英文

三句話摘要

DeepSeq 發布的 DS PARC 推測解碼技術如何在不重新訓練模型的前提下實現 50-400% 的推理加速。 推測解碼通過輕量級草稿模型與智能驗證策略,在不改動模型權重的前提下實現 50-400% 推理加速,是生產級推理優化的高性價比方案。 解決解碼階段的內存瓶頸。傳統語言模型逐次生成令牌導致 GPU 等待成為主要開銷;DS PARC 讓小型模型在單次前向傳遞中猜測多個令牌,大型模型也在一次前向傳遞中驗證整個塊,大幅減少前向傳遞次數。

重點整理

重點
  • 1

    解決解碼階段的內存瓶頸。傳統語言模型逐次生成令牌導致 GPU 等待成為主要開銷;DS PARC 讓小型模型在單次前向傳遞中猜測多個令牌,大型模型也在一次前向傳遞中驗證整個塊,大幅減少前向傳遞次數。

  • 2

    半自迴歸設計克服先前方法的兩大問題。自迴歸模型(如 Eagle 3)精確但速度慢,並行模型(如 Dragonfly Flash)雖快但存在"尾部漂移"——後續令牌相互忽視導致錯誤率升高;DS PARC 加入輕量級串行頭讓各令牌能看到前驅令牌,既保持並行效率又消除漂移,接受長度比 Eagle 3 增加 30%、比 Dragonfly Flash 增加 16-18%。

  • 3

    置信度調度驗證針對生產環境優化。系統評估每個令牌的存活概率,伺服器負載輕時驗證整個塊,負載重時僅驗證高置信度前綴,避免浪費計算資源在必然被拒絕的令牌上。

  • 4

    完全開源的模型無關插件。DS PARC 是可附加到任何模型架構的輕量級頭,無需修改原始模型,已驗證支持 Qwen 和 Gemma 等開源模型,降低部署門檻。

實用技巧與重點

乾貨
  • 推理加速幅度:50-400%(不需重新訓練或量化)
  • 生產環保境改善:令牌延遲降低 57-85%(相同總吞吐量下)
  • 塊長度增長:比 Eagle 3 提升約 30%;比 Dragonfly Flash 提升 16-18%
  • 支持的模型:Claude Opus Flash、Claude Opus Pro、Qwen、Gemma
  • 關鍵公式:單位令牌時間 = (草稿時間 + 驗證時間) / 每輪接受的令牌數
  • 可優化的三個維度:(1) 降低草稿模型延遲;(2) 提高草稿品質以增加單輪接受數;(3) 減少驗證時間
  • 開源代碼庫:DeepSpecs(包含訓練代碼和草稿模型檢查點)
  • 先前方法的局限:自迴歸模型(Eagle 3)、並行模型(Dragonfly Flash)的尾部漂移問題

結論

結論

推測解碼通過輕量級草稿模型與智能驗證策略,在不改動模型權重的前提下實現 50-400% 推理加速,是生產級推理優化的高性價比方案。

完整解析

詳細

大型語言模型的推理過程長期面臨效能瓶頸。傳統方式下模型逐次生成令牌——稱為"下一個令牌預測器"——生成六個令牌的句子需要六次前向傳遞。這導致延遲隨生成長度線性增長。更關鍵的問題在於解碼階段本質上是內存受限的:GPU 主要耗時在等待下一個令牌生成,即使面對長序列也無法充分利用計算能力。

DeepSeq 的 DS PARC 技術通過引入小型快速草稿模型來根本性解決此問題。基本原理是:小型模型在單次前向傳遞中猜測多個令牌塊(如六個令牌),隨後大型目標模型也在單次前向傳遞中驗證整個塊。若所有令牌都被驗證正確就全部保留;若某位置出錯,模型保留正確前綴後停止,由大型模型補充該位置。最終輸出與單獨使用大型模型完全相同,實現了無損加速。單位令牌的處理時間受三個因素影響:草稿時間、驗證時間與單輪接受的令牌數。優化空間包括選擇更快的草稿模型、提高草稿品質以增加單輪接受數、減少驗證開銷。

先前的推測解碼方法存在關鍵局限。自迴歸草稿模型(如 Eagle 3)須逐次處理令牌導致速度慢且易卡在小塊;並行草稿模型(如 Dragonfly Flash)雖然快速但會產生"尾部漂移"——後續位置的令牌相互忽視導致錯誤率升高。DS PARC 的創新在於採用"半自迴歸"設計:保持重型草稿主幹的完全並行特性以維持速度,但在其上疊加輕量級串行頭,讓每個令牌能觀察其前驅令牌。這直接解決尾部漂移問題,使 DS PARC 能接受比 Eagle 3 長 30% 的塊、比 Dragonfly Flash 長 16-18% 的塊。

為適應生產環境需求,DS PARC 加入置信度評分機制,預測哪些令牌會被驗證通過。系統根據伺服器負載動態調整:負載輕時驗證整個塊,負載重時僅驗證高置信度前綴,剩餘令牌跳過。這確保計算資源優先分配給真實用戶請求。DS PARC 並非單純研究論文,已在 Claude Opus Flash 和 Claude Opus Pro 的生產系統中部署。實測數據顯示在相同總吞吐量下,用戶獲取單個令牌的延遲降低 57-85%,且無需額外硬體投入。技術完全開源發布,以輕量級插件頭的形式實現,可無縫附加到任何模型架構而無需修改原始結構,已驗證支持 Qwen 和 Gemma 等開源模型。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。