KeyFrame內部研究專用

The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten

Latent Space·8月3日週一·101 min英文

三句話摘要

推論工程深度解析:從查詢路由、投機解碼、量化優化到硬體架構的系統設計。 推論工程的下半場已從低層核心優化轉向系統級調度,未來的競爭力在於如何整合硬體、快取策略與模型架構,而非單純的計算加速。 緩存意識路由決定整體效率

重點整理

重點
  • 1

    緩存意識路由決定整體效率

  • 2

    長 query 進來後第一步是檢查已有快取的模型副本,若存在部分快取則跳過該部分 prefill,直接進入解碼階段。這對 200k token 的編程或多輪對話場景效果最佳,因為這些場景本就容易產生重複輸入。

  • 3

    投機解碼是當下最實用的加速手段

  • 4

    基礎想法是用一個小模型(通常百億參數)快速預測 3 個 token,主模型驗證這些預測,正確則直接採納,錯誤則回溯。投機器訓練很關鍵——需用實際推論隱狀態作訓練資料,流量特定(編程 vs 文本總結)的投機器效果差異大。

  • 5

    量化不一定降質,關鍵在層數選擇

  • 6

    常見誤解是量化越多質量越差。實際上若選對層數讓量化誤差互相抵消(一層右移、一層左移),最終邏輯分佈能更接近原始精度,結果反而更優。Base10 研究表明 NVF4 量化多於競品卻保持更高精度。

  • 7

    新模型發佈是工程爆發

  • 8

    GLM 5.2 或 Kimi K3 發佈時,業者需:(1) 重新量化到 NVF4;(2) 用新模型權重訓練投機器;(3) 在自有推論棧適配新架構(如 DSA 注意力機制);(4) 上線後持續修補(如 token 迴圈、模式崩潰)。每次都是天級工作量。

實用技巧與重點

乾貨
  • 推論系統組成
  • 緩存意識路由 (KV-aware routing)
  • 預填層 (prefill) 與解碼層 (decode) 分離
  • 投機解碼模型 (speculator)
  • 結構化輸出約束 (BNF 文法或狀態機)
  • 量化與加速數字
  • FP16 → NVF4:約 60-80% 吞吐提升(30-40% × 2 層)
  • 投機解碼:約 2 倍速
  • 緩存命中率高時可達 10 倍總體加速
  • 無優化基線:30-50 tokens/sec;全優化:300-400 tokens/sec
  • 硬體規格(單位:GB)
  • H100:80 GB HBM(8 GPU 節點 = 640 GB)
  • B200:180 GB HBM(8 GPU 節點 = 1,440 GB)
  • Kimi 3(2.8T 參數)= 1.4 TB NVF4(需 GB300×8 或 AMD 等量硬體)
  • 新模型上線檢查清單
  • ✓ 量化:FP4、校準、層數選擇
  • ✓ 投機器:用公開資料集(編程、代理任務)訓練
  • ✓ 架構適配:新注意力機制、flash attention、DSA 等
  • ✓ 質檢:上線後持續監控邊界情況(token 迴圈、模式崩潰)
  • 並行化策略
  • 張量平行 (TP):優化延遲,需要高頻寬互連 (NVLink)
  • 專家平行 (EP):MoE 模型用,優化吞吐
  • 管道平行 (PP):多節點時才用,跨節點互連慢
  • 自動調參:無通用最優配置,實驗才知道
  • 量化精度保留
  • 不量化:嵌入層、模態投影層、輸出投影層
  • 選擇量化:計算層,設計讓誤差互相抵消
  • 評估方式:KL 散度(邏輯分佈相似度),而非只看基準分數
  • 視頻模型挑戰
  • 5 秒視頻 480p 16fps ≈ 35,000 tokens(attention 複雜度平方)
  • 完整注意力 → 計算不可行;稀疏注意力 → 質量下降
  • 開源 (Luma 1.2) vs 閉源 (Kling/Veo):質量差異「天壤之別」

結論

結論

推論工程的下半場已從低層核心優化轉向系統級調度,未來的競爭力在於如何整合硬體、快取策略與模型架構,而非單純的計算加速。

完整解析

詳細

推論工程是 LLM 產品化的關鍵環節,但常被忽視。訪談中 Philip 和 Ali 深入討論了現代推論系統如何在數十毫秒內處理數十萬 token 的查詢。

核心流程以緩存為中心。當用戶發送 200k token 的查詢時,系統首先檢查是否有已存在快取。若過去見過這個查詢的全部或部分內容,就能直接路由到擁有該緩存的 GPU 副本,這能節省巨大開銷。若無快取,查詢進入 prefill 階段(由專門的 prefill worker 處理),生成初始 token 後交給解碼層(decode worker)逐個生成後續 token。投機解碼層疊在上面——一個小模型先快速預測 3 個 token,由主模型一次驗證,正確率高的話能有效 2 倍加速。

量化是推論優化的核心卻最容易被誤解的技術。Base10 的研究推翻了「量化越多越差」的直覺。他們發現若精心選擇量化的層次,讓不同層的量化誤差互相抵消(一層的舍入偏高、另一層偏低),最終邏輯分佈(logit distribution)反而更接近原始 FP16 模型,精度提高 20%。評估方式也很關鍵——用 KL 散度衡量邏輯分佈相似度,而非只看基準測試分數,因為後者容易受噪聲影響。

新模型發佈時工程工作爆發式增長。GLM 5.2 或 Kimi K3 推出後,Base10 需要在 24-48 小時內完成:量化到 NVF4 並校準、用新模型權重訓練投機器(需數小時到一天)、在自有推論棧支援新架構(某些模型引入 DSA 注意力機制需編寫新核心支援)。有趣的是,像 Deep Seek 這樣有新穎架構的模型甚至需要從其他開源模型「移植」元件——比如 Base10 在 GLM 5.2(無視覺)上嫁接了 Kimi 的視覺編碼器,只訓練投影層連接大腦和眼睛,最終得到視覺能力完整但推論品質無損的模型。

硬體層面,趨勢從核心優化轉向系統設計。Ampere、Hopper、Blackwell 三代 GPU 中,每代都需要重新優化推論引擎的核心和記憶體佈局。未來的 Rubin GPU 加入了 TMA(張量記憶體加速器)等專用硬體,使得推論工程重點從「寫什麼 CUDA 核心」轉向「怎麼調度 KV 快取、怎麼管理多 GPU 通訊」。並行化策略也因此改變——張量平行依賴高頻寬互連,專家平行用於 MoE 模型,管道平行只在被迫跨節點時才用。沒有通用最優配置,必須對特定硬體和流量負載做自動調參。

視頻擴散模型面臨獨有挑戰。生成 5 秒高品質視頻就產生 35,000+ token,注意力複雜度的平方律讓完整自注意力變得計算不可行。稀疏注意力(只注意最相關的 token)雖然節省計算但會顯著降低質量。這導致開源視頻模型(Luma 1.2)與閉源方案(Kling、Veo)質量差異巨大,反過來抑制開源投資,形成惡性循環。即便開源能便宜 100 倍也無法改變用戶選擇,因為質量缺口太大。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。