KeyFrame內部研究專用

DeepSeek's New AI Speed Hack Is Amazing

Two Minute Papers·7月7日週二·5 min英文

三句話摘要

DeepSeek 的 DeepSpark 技術如何透過推測解碼加速 AI 推理,實現 60-85% 的速度提升。 DeepSpark 用系統級的推測解碼替代逐詞推理,實現 60-85% 的速度提升,為手機等資源受限的設備上部署實用 AI 打開了新的可能。 解決逐詞推理瓶頸 — 傳統 AI 逐詞思考導致系統緩慢昂貴,用推測解碼讓小模型先快速生成多詞,大模型再驗證,若驗證失敗從該點丟棄,降低計算成本。

重點整理

重點
  • 1

    解決逐詞推理瓶頸 — 傳統 AI 逐詞思考導致系統緩慢昂貴,用推測解碼讓小模型先快速生成多詞,大模型再驗證,若驗證失敗從該點丟棄,降低計算成本。

  • 2

    三層優化設計 — DeepSpark 為小模型添加有限記憶維持連貫性、預測容易被否決的詞汇自動跳過驗證、根據工作負載類型(代碼精準度高、創意寫作風險大)動態調整驗證頻率。

  • 3

    任務相關的效能差異 — 代碼生成和數學計算因下詞高度可預測而獲益最多,開放式創意寫作可能答案眾多、初級模型易出錯,收益有限。

  • 4

    系統級優化非模型升級 — 不改進 AI 能力本身,而是改進推理架構,需要特定的配置和內部 API 訪問,無法通過外部方式添加到閉源系統。

實用技巧與重點

乾貨
  • 技術名稱:DeepSpark(DeepSeek 研發)
  • 前置技術:MTP1(舊多詞預測基準線)
  • 性能數據:60-85% 速度提升(標準情況)、661% 吞吐量提升(極端邊界情況)
  • 三個核心優化
  • 初級模型加小規模記憶
  • 預測高風險詞汇自動過濾
  • 按任務類型動態調整驗證策略
  • 最佳應用場景:代碼生成、數學計算
  • 次優應用場景:開放式創意寫作
  • 實現要求:配套草稿模型、目標模型概率訪問、優化推理系統
  • 發佈方式:開放科學、免費提供

結論

結論

DeepSpark 用系統級的推測解碼替代逐詞推理,實現 60-85% 的速度提升,為手機等資源受限的設備上部署實用 AI 打開了新的可能。

完整解析

詳細

傳統 AI 系統在生成文本時逐詞推理,這形成了嚴重的性能瓶頸。當使用者要求 AI 改寫郵件時,系統必須逐詞思考並計算,每一步都要調動完整的神經網絡進行推理。這使得 AI 的運行既緩慢又昂貴,尤其在需要實時反應的場景中成為巨大的障礙。

DeepSeek 團隊提出了一個簡潔而優雅的解決方案:不讓強大的大模型單獨處理所有工作,而是建立「初級編輯加高級編輯」的架構。初級編輯(小模型)負責快速生成接下來的多個詞彙,高級編輯(大模型)對其進行驗證。若高級編輯認可,這些詞汇就被接受;一旦發現不合邏輯之處(例如地球問題卻從「千層麵」開頭),則該點之後的所有詞彙全部舍棄。這套被稱為「推測解碼」的方法大幅降低了計算成本——若初級編輯預測得當,便以廉價快速的方式獲得多詞輸出,而驗證只需大模型檢查一遍。

然而初級編輯容易出錯:它可能忽略上文、開始一個句子卻用另一個結尾。DeepSpark 針對此問題引入了三項創新。首先,為小模型添加有限的記憶機制,讓生成的詞彙能彼此影響,從而保持語義連貫而無需龐大的計算能力。其次,系統會提前預測哪些詞彙生成後很可能被大模型駁回(如代數題卻輸出無關內容),對這些詞彙跳過驗證以節省 GPU 時間。第三,系統根據任務類型動態調整——代碼和數學任務中下一詞往往高度可預測,初級模型表現優異、驗證開銷少;而開放式創意寫作中可能答案眾多、風險遠高,需要更頻繁的驗證。

實測結果顯示 DeepSpark 在 DeepSeek 的 Flash 和 Pro 模型上實現了 60-85% 的速度提升,相比舊的 MTP1 基準線。雖然在特殊邊界情況下可達 661% 的吞吐量提升,但那僅限於老系統資源耗盡的極端場景。最令人欣慰的是,DeepSeek 以開放科學的方式免費提供了這項成果。然而實現它並非簡單的軟體升級,需要配套的草稿模型、對目標模型內部概率的訪問權限、以及優化過的推理系統,無法通過外部方式添加到任何閉源 API 中。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。