Kimi K3把Gemini压下去了?SemiAnalysis这期播客,排名反而不是重点
三句話摘要
Kimi K3 進入全球前沿模型第一梯隊背後的工程真相與商業啟發。 K3 的成功不在參數,在於工程:從推理架構優化到硬件協同,再到生態同步發布,展示了大模型下半場真正考驗的是系統工程能力,而不是單純的模型參數或訓練數據。 參數量不能直接比較,真正看的是縮放效率和硬件成本:K3 雖有 2.8T 參數,但相對於 K2 的縮放效率提升約 2.5 倍。單張 B200 無法部署此模型(顯存僅 1.44TB vs 模型需求 1.4TB+),官方建議 64 卡以上的 Supernode 正是因為 K3 的超高稀疏 MoE 架構對大規模高帶寬通信的依賴。
重點整理
重點- 1
參數量不能直接比較,真正看的是縮放效率和硬件成本:K3 雖有 2.8T 參數,但相對於 K2 的縮放效率提升約 2.5 倍。單張 B200 無法部署此模型(顯存僅 1.44TB vs 模型需求 1.4TB+),官方建議 64 卡以上的 Supernode 正是因為 K3 的超高稀疏 MoE 架構對大規模高帶寬通信的依賴。
- 2
權重分階段發布背後是工程同步,不是營銷策略:K3 API 先上線、完整權重 7 月 27 日前發布,這段時間乐制暗面在與推理服務商和開源社區協調代碼、適配 VLLM 的 KDA 實現。如果權重直接放出而推理引擎未準備好,模型上線當天就會因吞吐量低而口碑崩塌。
- 3
MXFP4/MXFP8 量化不是硬件兼容性的承諾,而是標準化低精度格式的前置優化:採用 AMD、Intel、Meta、Microsoft、NVIDIA 等共同推動的 OCP 標準,既降低推理成本也為國產加速器等多元硬件後端預留適配空間,反映出模型在底層架構上已為多硬件生態做準備。
- 4
推理成本與工程效率正在重塑大模型的商業模型:K3 的價格相比 K2.7 漲 3–3.75 倍,但真正值得關注的是 2.8T 模型能否在高並發下把 per-token 成本壓到足夠低。未來競爭不是純能力比拼,而是推理成本、並發能力和硬件協同的綜合較量。
實用技巧與重點
乾貨- 模型與硬件規格:
- K3 總參數:2.8T(相對 K2 縮放效率提升 ~2.5 倍)
- 推理速度:約 62 Token/秒(低於平台平均,但可用)
- 推薦部署配置:64 張以上加速卡組成的 Supernode
- 單張 B200 顯存:~1.44TB(不足以單卡部署)
- 8 張 B200 總顯存:~11.5TB(K3 模型需求 ~1.4TB,但考慮 KV Cache 和運行空間,實際需要 64 卡+)
- 技術規格:
- 量化方案:MXFP4 權重、MXFP8 激活(OCP 標準)
- 架構:超高稀疏 MoE + 專家並行(高度依賴大規模通信域)
- 訓練方法:自 SFT 階段開始進行量化感知訓練
- 發布時間線:
- API 上線:7 月 18 日(Semi-Analysis 提出判斷當日)
- 完整權重發布:計畫在 7 月 27 日前
- 定價(vs K2.7):
- 緩存命中輸入:$3/百萬 Token(↑ ~3.2 倍)
- 輸出:$15/百萬 Token(↑ ~3.75 倍)
- 排名與評測:
- Semi-Analysis 綜合基準:進入全球前 3(排在 Claude 3、GPT-4o 後)
- Artificial Analysis(7 月 20 日):排名第 4(發布次日一度為第 3)
- Jordan 個人評價:從可用性角度可能是第二好用的模型(相比 Claude 50 穩定性更高)
結論
結論“K3 的成功不在參數,在於工程:從推理架構優化到硬件協同,再到生態同步發布,展示了大模型下半場真正考驗的是系統工程能力,而不是單純的模型參數或訓練數據。”
完整解析
詳細Kimi K3 發布後迅速進入全球前沿模型第一梯隊,但這背後暴露了一個看似矛盾的工程問題:一個宣布開放權重的模型,為何需要 64 張以上的加速卡才能部署,而推理速度反而成了瓶頸?
從參數量角度看,2.8T 是個龐大的數字,但直接拿它和 OpenAI、Anthropic 的閉源模型比較沒有意義——後者根本沒有公布總參數。K3 真正值得關注的是算法和系統工程帶來的縮放效率提升。乐制暗面官方宣稱 K3 相對 K2 的縮放效率提升約 2.5 倍,這說明同樣的推理效果可以用更少的算力來達成。但這也恰恰說明,參數量大並不意味著硬件要求就小。
硬件部署的真相在於 K3 的架構特性。單張 B200 顯存約 1.44TB,而 K3 模型本身在 4 比特量化下也需要約 1.4TB,這還沒算 KV Cache 和運行時緩衝區。8 張 B200 看似足夠(總顯存 ~11.5TB),但 K3 採用超高稀疏 MoE 和專家並行架構,這種設計對大規模高帶寬通信的依賴遠高於傳統模型。因此,官方建議 64 卡以上的 Supernode 不是營銷噱頭,而是確保高吞吐量和低延遲的必要條件。這給行業一個重要信號:未來大模型的瓶頸正在從單卡顯存轉向跨卡通信和並發架構的優化。
更有意思的是權重的分階段發布。K3 API 於 7 月 18 日先上線,但完整權重計畫在 7 月 27 日前才發布。為什麼不直接放出?Max 的推測是,乐制暗面正在和推理服務商與開源社區協調代碼,確保 VLLM、SGLAN 等推理引擎能及時支持 K3 的新架構。如果權重直接放出而生態還沒準備好,用戶會發現推理速度極慢、吞吐量低,模型的口碑瞬間崩塌。這段時間的同步工作是為了保證上線當天的推理體驗能滿足預期。這對整個行業的啟發是深遠的:權重只是起點,推理引擎的優化和硬件生態的適配才是決定用戶體驗的關鍵。
在量化方案上,K3 採用 MXFP4 權重和 MXFP8 激活,這是由 AMD、Intel、Meta、Microsoft、NVIDIA 等共同推動的 OCP 標準。這不是為某一款芯片做特殊優化,而是為多元硬件生態預留適配空間。這種選擇既降低了推理成本(低精度計算本身更快更省電),也暗示乐制暗面在為國產加速器等新興硬件的部署做準備。
從商業角度看,K3 的價格相比 K2.7 漲了 3–3.75 倍,但真正值得觀察的是它能否在實際高並發場景下把 per-token 成本壓到足夠低。大模型產業從單純的「參數越大越好」進入了新階段:推理成本優化、並發能力、和硬件協同的綜合較量才是核心競爭力。中美模型差距的縮小,不只是技術突破或政策窗口,更是推理工程和成本控制的結果。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


