The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten
三句話摘要
推論工程深度解析:從查詢路由、投機解碼、量化優化到硬體架構的系統設計。 推論工程的下半場已從低層核心優化轉向系統級調度,未來的競爭力在於如何整合硬體、快取策略與模型架構,而非單純的計算加速。 緩存意識路由決定整體效率
重點整理
重點- 1
緩存意識路由決定整體效率
- 2
長 query 進來後第一步是檢查已有快取的模型副本,若存在部分快取則跳過該部分 prefill,直接進入解碼階段。這對 200k token 的編程或多輪對話場景效果最佳,因為這些場景本就容易產生重複輸入。
- 3
投機解碼是當下最實用的加速手段
- 4
基礎想法是用一個小模型(通常百億參數)快速預測 3 個 token,主模型驗證這些預測,正確則直接採納,錯誤則回溯。投機器訓練很關鍵——需用實際推論隱狀態作訓練資料,流量特定(編程 vs 文本總結)的投機器效果差異大。
- 5
量化不一定降質,關鍵在層數選擇
- 6
常見誤解是量化越多質量越差。實際上若選對層數讓量化誤差互相抵消(一層右移、一層左移),最終邏輯分佈能更接近原始精度,結果反而更優。Base10 研究表明 NVF4 量化多於競品卻保持更高精度。
- 7
新模型發佈是工程爆發
- 8
GLM 5.2 或 Kimi K3 發佈時,業者需:(1) 重新量化到 NVF4;(2) 用新模型權重訓練投機器;(3) 在自有推論棧適配新架構(如 DSA 注意力機制);(4) 上線後持續修補(如 token 迴圈、模式崩潰)。每次都是天級工作量。
實用技巧與重點
乾貨- 推論系統組成
- 緩存意識路由 (KV-aware routing)
- 預填層 (prefill) 與解碼層 (decode) 分離
- 投機解碼模型 (speculator)
- 結構化輸出約束 (BNF 文法或狀態機)
- 量化與加速數字
- FP16 → NVF4:約 60-80% 吞吐提升(30-40% × 2 層)
- 投機解碼:約 2 倍速
- 緩存命中率高時可達 10 倍總體加速
- 無優化基線:30-50 tokens/sec;全優化:300-400 tokens/sec
- 硬體規格(單位:GB)
- H100:80 GB HBM(8 GPU 節點 = 640 GB)
- B200:180 GB HBM(8 GPU 節點 = 1,440 GB)
- Kimi 3(2.8T 參數)= 1.4 TB NVF4(需 GB300×8 或 AMD 等量硬體)
- 新模型上線檢查清單
- ✓ 量化:FP4、校準、層數選擇
- ✓ 投機器:用公開資料集(編程、代理任務)訓練
- ✓ 架構適配:新注意力機制、flash attention、DSA 等
- ✓ 質檢:上線後持續監控邊界情況(token 迴圈、模式崩潰)
- 並行化策略
- 張量平行 (TP):優化延遲,需要高頻寬互連 (NVLink)
- 專家平行 (EP):MoE 模型用,優化吞吐
- 管道平行 (PP):多節點時才用,跨節點互連慢
- 自動調參:無通用最優配置,實驗才知道
- 量化精度保留
- 不量化:嵌入層、模態投影層、輸出投影層
- 選擇量化:計算層,設計讓誤差互相抵消
- 評估方式:KL 散度(邏輯分佈相似度),而非只看基準分數
- 視頻模型挑戰
- 5 秒視頻 480p 16fps ≈ 35,000 tokens(attention 複雜度平方)
- 完整注意力 → 計算不可行;稀疏注意力 → 質量下降
- 開源 (Luma 1.2) vs 閉源 (Kling/Veo):質量差異「天壤之別」
結論
結論“推論工程的下半場已從低層核心優化轉向系統級調度,未來的競爭力在於如何整合硬體、快取策略與模型架構,而非單純的計算加速。”
完整解析
詳細推論工程是 LLM 產品化的關鍵環節,但常被忽視。訪談中 Philip 和 Ali 深入討論了現代推論系統如何在數十毫秒內處理數十萬 token 的查詢。
核心流程以緩存為中心。當用戶發送 200k token 的查詢時,系統首先檢查是否有已存在快取。若過去見過這個查詢的全部或部分內容,就能直接路由到擁有該緩存的 GPU 副本,這能節省巨大開銷。若無快取,查詢進入 prefill 階段(由專門的 prefill worker 處理),生成初始 token 後交給解碼層(decode worker)逐個生成後續 token。投機解碼層疊在上面——一個小模型先快速預測 3 個 token,由主模型一次驗證,正確率高的話能有效 2 倍加速。
量化是推論優化的核心卻最容易被誤解的技術。Base10 的研究推翻了「量化越多越差」的直覺。他們發現若精心選擇量化的層次,讓不同層的量化誤差互相抵消(一層的舍入偏高、另一層偏低),最終邏輯分佈(logit distribution)反而更接近原始 FP16 模型,精度提高 20%。評估方式也很關鍵——用 KL 散度衡量邏輯分佈相似度,而非只看基準測試分數,因為後者容易受噪聲影響。
新模型發佈時工程工作爆發式增長。GLM 5.2 或 Kimi K3 推出後,Base10 需要在 24-48 小時內完成:量化到 NVF4 並校準、用新模型權重訓練投機器(需數小時到一天)、在自有推論棧支援新架構(某些模型引入 DSA 注意力機制需編寫新核心支援)。有趣的是,像 Deep Seek 這樣有新穎架構的模型甚至需要從其他開源模型「移植」元件——比如 Base10 在 GLM 5.2(無視覺)上嫁接了 Kimi 的視覺編碼器,只訓練投影層連接大腦和眼睛,最終得到視覺能力完整但推論品質無損的模型。
硬體層面,趨勢從核心優化轉向系統設計。Ampere、Hopper、Blackwell 三代 GPU 中,每代都需要重新優化推論引擎的核心和記憶體佈局。未來的 Rubin GPU 加入了 TMA(張量記憶體加速器)等專用硬體,使得推論工程重點從「寫什麼 CUDA 核心」轉向「怎麼調度 KV 快取、怎麼管理多 GPU 通訊」。並行化策略也因此改變——張量平行依賴高頻寬互連,專家平行用於 MoE 模型,管道平行只在被迫跨節點時才用。沒有通用最優配置,必須對特定硬體和流量負載做自動調參。
視頻擴散模型面臨獨有挑戰。生成 5 秒高品質視頻就產生 35,000+ token,注意力複雜度的平方律讓完整自注意力變得計算不可行。稀疏注意力(只注意最相關的 token)雖然節省計算但會顯著降低質量。這導致開源視頻模型(Luma 1.2)與閉源方案(Kling、Veo)質量差異巨大,反過來抑制開源投資,形成惡性循環。即便開源能便宜 100 倍也無法改變用戶選擇,因為質量缺口太大。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


