KeyFrame內部研究專用

DeepSeek Just Solved AI's Billion Dollar Problem

Two Minute Papers·6月22日週一·5 min英文

三句話摘要

DeepSeek 提出一種流量管理方案,透過重新分配已有的計算資源,將 AI 推理系統的 GPU 利用率從 40% 提升至 80%。 透過智慧地重新分配已有資源與實施精細的優先級控制,DeepSeek 在零硬件投資的前提下將 AI 推理效率翻倍,證明了開源科學對產業的實質貢獻。 AI 系統的效率危機源於頻寬瓶頸而非計算瓶頸。系統大部分時間用於等待和讀取數據,而非執行計算,這就像一個巨大的大腦卻只有一根吸管連接外界。

重點整理

重點
  • 1

    AI 系統的效率危機源於頻寬瓶頸而非計算瓶頸。系統大部分時間用於等待和讀取數據,而非執行計算,這就像一個巨大的大腦卻只有一根吸管連接外界。

  • 2

    DeepSeek 的解決方案利用現有但未充分利用的資源。預填充機和解碼機在網絡中職責不同,閒置的解碼機可以承擔數據讀取任務,建立平行路徑送往預填充機進行計算。

  • 3

    流量優先級控制是方案可行的核心。新增的記憶流量與既有的計算流量共用高速通道,透過為計算流量設置高優先級、記憶流量使用剩餘帶寬,避免引入新的堵塞點。

  • 4

    該方案對長對話和多轉換智能體工作最有效。這類場景需要重複讀取大量上下文資料,是當今 AI 應用中最耗費資源但最常見的工作模式。

實用技巧與重點

乾貨
  • 現狀 GPU 利用率:40%
  • 改進後 GPU 利用率:80%
  • 性能提升倍數:接近 2 倍
  • 機器類型:Pre-fill machines(預填充機)、Decoding machines(解碼機)
  • 目標工作負載:Long, multi-turn, agentic workloads
  • 流量優先級:計算流量高優先,記憶流量使用剩餘空間
  • 開源模式:完全免費公開
  • 典型案例:DeepSeek 模型 671 billion parameters 在 Lambda GPU Cloud 上運行
  • 部署層級:數據中心基礎設施級別,非終端用戶層面

結論

結論

透過智慧地重新分配已有資源與實施精細的優先級控制,DeepSeek 在零硬件投資的前提下將 AI 推理效率翻倍,證明了開源科學對產業的實質貢獻。

完整解析

詳細

當前 AI 推理系統面臨一個看似矛盾的效率困境:儘管企業投入數十億美元購置頂級計算硬件,GPU 利用率卻長期停留在 40% 左右。這個問題的根源不在於計算能力本身,而在於數據進入系統的速度。用講者的比喻來說,就像一個容量巨大的大腦(GPU 計算單元),卻只有一根狹窄的吸管(內存帶寬)來吸取信息。系統花費大量時間陷入等待,而不是執行有用的計算。這種情況在處理長對話和複雜智能體任務時最為嚴重,因為每個新的對話轉換都需要系統重新讀取所有之前的上下文資料,導致讀取成本不斷累積。

DeepSeek 的解決方案源於對現有網絡架構的精細觀察。他們發現系統中存在兩類機器,各司其職卻利用不當:預填充機器負責初始數據讀取,常年超載運轉;而解碼機器負責生成輸出,卻經常閒置無用。與其盲目追求更多計算能力,DeepSeek 提出了一個巧妙的設計——讓原本閒置的解碼機器參與數據讀取工作,建立一條平行的數據流向預填充機器。這樣既避免了新硬件投資,又充分利用了已有資源。

這個方案的關鍵難點在於避免引入新的瓶頸。新增的數據路徑必須經過與計算任務相同的高速通道,如果管理不當,勢必造成新的交通擁堵。DeepSeek 的解決方案是實施優先級控制:計算流量(執行思考)獲得最高優先級,而記憶流量(數據讀取)只能使用剩餘的帶寬。這樣的安排既保護了核心計算任務,又讓原本浪費的資源得以利用,體現了極高的系統設計智慧。

最終的成果令人矚目:GPU 利用率從 40% 躍升到 80%,相當於用完全相同的硬件實現了近乎翻倍的吞吐量。這種改進特別適用於長對話、多轉換的智能體工作流,正好是當今 AI 應用的常見場景。更為難得的是,DeepSeek 選擇將這項技術完全開源,免費提供給全球,讓整個行業都能受益。這不是能輕易做成標題的「新模型」,而是系統級的基礎設施改進,適合在數據中心部署,最終為最終用戶帶來更便宜的 AI 推理成本。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。