KeyFrame內部研究專用

Kimi K3把Gemini压下去了?SemiAnalysis这期播客,排名反而不是重点

Why QQ·7月24日週五·8 min中文

三句話摘要

Kimi K3 進入全球前沿模型第一梯隊背後的工程真相與商業啟發。 K3 的成功不在參數,在於工程:從推理架構優化到硬件協同,再到生態同步發布,展示了大模型下半場真正考驗的是系統工程能力,而不是單純的模型參數或訓練數據。 參數量不能直接比較,真正看的是縮放效率和硬件成本:K3 雖有 2.8T 參數,但相對於 K2 的縮放效率提升約 2.5 倍。單張 B200 無法部署此模型(顯存僅 1.44TB vs 模型需求 1.4TB+),官方建議 64 卡以上的 Supernode 正是因為 K3 的超高稀疏 MoE 架構對大規模高帶寬通信的依賴。

重點整理

重點
  • 1

    參數量不能直接比較,真正看的是縮放效率和硬件成本:K3 雖有 2.8T 參數,但相對於 K2 的縮放效率提升約 2.5 倍。單張 B200 無法部署此模型(顯存僅 1.44TB vs 模型需求 1.4TB+),官方建議 64 卡以上的 Supernode 正是因為 K3 的超高稀疏 MoE 架構對大規模高帶寬通信的依賴。

  • 2

    權重分階段發布背後是工程同步,不是營銷策略:K3 API 先上線、完整權重 7 月 27 日前發布,這段時間乐制暗面在與推理服務商和開源社區協調代碼、適配 VLLM 的 KDA 實現。如果權重直接放出而推理引擎未準備好,模型上線當天就會因吞吐量低而口碑崩塌。

  • 3

    MXFP4/MXFP8 量化不是硬件兼容性的承諾,而是標準化低精度格式的前置優化:採用 AMD、Intel、Meta、Microsoft、NVIDIA 等共同推動的 OCP 標準,既降低推理成本也為國產加速器等多元硬件後端預留適配空間,反映出模型在底層架構上已為多硬件生態做準備。

  • 4

    推理成本與工程效率正在重塑大模型的商業模型:K3 的價格相比 K2.7 漲 3–3.75 倍,但真正值得關注的是 2.8T 模型能否在高並發下把 per-token 成本壓到足夠低。未來競爭不是純能力比拼,而是推理成本、並發能力和硬件協同的綜合較量。

實用技巧與重點

乾貨
  • 模型與硬件規格:
  • K3 總參數:2.8T(相對 K2 縮放效率提升 ~2.5 倍)
  • 推理速度:約 62 Token/秒(低於平台平均,但可用)
  • 推薦部署配置:64 張以上加速卡組成的 Supernode
  • 單張 B200 顯存:~1.44TB(不足以單卡部署)
  • 8 張 B200 總顯存:~11.5TB(K3 模型需求 ~1.4TB,但考慮 KV Cache 和運行空間,實際需要 64 卡+)
  • 技術規格:
  • 量化方案:MXFP4 權重、MXFP8 激活(OCP 標準)
  • 架構:超高稀疏 MoE + 專家並行(高度依賴大規模通信域)
  • 訓練方法:自 SFT 階段開始進行量化感知訓練
  • 發布時間線:
  • API 上線:7 月 18 日(Semi-Analysis 提出判斷當日)
  • 完整權重發布:計畫在 7 月 27 日前
  • 定價(vs K2.7):
  • 緩存命中輸入:$3/百萬 Token(↑ ~3.2 倍)
  • 輸出:$15/百萬 Token(↑ ~3.75 倍)
  • 排名與評測:
  • Semi-Analysis 綜合基準:進入全球前 3(排在 Claude 3、GPT-4o 後)
  • Artificial Analysis(7 月 20 日):排名第 4(發布次日一度為第 3)
  • Jordan 個人評價:從可用性角度可能是第二好用的模型(相比 Claude 50 穩定性更高)

結論

結論

K3 的成功不在參數,在於工程:從推理架構優化到硬件協同,再到生態同步發布,展示了大模型下半場真正考驗的是系統工程能力,而不是單純的模型參數或訓練數據。

完整解析

詳細

Kimi K3 發布後迅速進入全球前沿模型第一梯隊,但這背後暴露了一個看似矛盾的工程問題:一個宣布開放權重的模型,為何需要 64 張以上的加速卡才能部署,而推理速度反而成了瓶頸?

從參數量角度看,2.8T 是個龐大的數字,但直接拿它和 OpenAI、Anthropic 的閉源模型比較沒有意義——後者根本沒有公布總參數。K3 真正值得關注的是算法和系統工程帶來的縮放效率提升。乐制暗面官方宣稱 K3 相對 K2 的縮放效率提升約 2.5 倍,這說明同樣的推理效果可以用更少的算力來達成。但這也恰恰說明,參數量大並不意味著硬件要求就小。

硬件部署的真相在於 K3 的架構特性。單張 B200 顯存約 1.44TB,而 K3 模型本身在 4 比特量化下也需要約 1.4TB,這還沒算 KV Cache 和運行時緩衝區。8 張 B200 看似足夠(總顯存 ~11.5TB),但 K3 採用超高稀疏 MoE 和專家並行架構,這種設計對大規模高帶寬通信的依賴遠高於傳統模型。因此,官方建議 64 卡以上的 Supernode 不是營銷噱頭,而是確保高吞吐量和低延遲的必要條件。這給行業一個重要信號:未來大模型的瓶頸正在從單卡顯存轉向跨卡通信和並發架構的優化。

更有意思的是權重的分階段發布。K3 API 於 7 月 18 日先上線,但完整權重計畫在 7 月 27 日前才發布。為什麼不直接放出?Max 的推測是,乐制暗面正在和推理服務商與開源社區協調代碼,確保 VLLM、SGLAN 等推理引擎能及時支持 K3 的新架構。如果權重直接放出而生態還沒準備好,用戶會發現推理速度極慢、吞吐量低,模型的口碑瞬間崩塌。這段時間的同步工作是為了保證上線當天的推理體驗能滿足預期。這對整個行業的啟發是深遠的:權重只是起點,推理引擎的優化和硬件生態的適配才是決定用戶體驗的關鍵。

在量化方案上,K3 採用 MXFP4 權重和 MXFP8 激活,這是由 AMD、Intel、Meta、Microsoft、NVIDIA 等共同推動的 OCP 標準。這不是為某一款芯片做特殊優化,而是為多元硬件生態預留適配空間。這種選擇既降低了推理成本(低精度計算本身更快更省電),也暗示乐制暗面在為國產加速器等新興硬件的部署做準備。

從商業角度看,K3 的價格相比 K2.7 漲了 3–3.75 倍,但真正值得觀察的是它能否在實際高並發場景下把 per-token 成本壓到足夠低。大模型產業從單純的「參數越大越好」進入了新階段:推理成本優化、並發能力、和硬件協同的綜合較量才是核心競爭力。中美模型差距的縮小,不只是技術突破或政策窗口,更是推理工程和成本控制的結果。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。