打開 Kimi K3:開源架構與做法全解析
三句話摘要
Kimi K3的工程哲學:如何用3倍參數卻不成比例成長的成本來縮小開源與閉源模型的差距 Kimi K3最值得學的不是參數大小,而是每個地方都在算同一筆帳,用工程精細度把開源與最強閉源的差距從6-9個月壓到3-5個月,但精致有代價——幻覺升高、價格攀升、基礎模型保留——需要理性評估準確度與成本的取捨。 混合專家的克制設計:900個專科醫生只每次叫醒16位,其餘休眠。透過Stable Latent MoE將信息壓縮再分派、Quantile Balancing均衡負載、Side 2 GLU平滑信號,讓大規模不必等於大成本。
重點整理
重點- 1
混合專家的克制設計:900個專科醫生只每次叫醒16位,其餘休眠。透過Stable Latent MoE將信息壓縮再分派、Quantile Balancing均衡負載、Side 2 GLU平滑信號,讓大規模不必等於大成本。
- 2
線性注意力取代全注意力:K3採用去年才實驗驗證的KDA(Kimi Delta Attention),改用「筆記法」邊讀邊記,新句只需更新筆記,跳過傳統的全文重新比對。搭配完全取消位置編碼(NoPE),讓閱讀長度能推到100萬token而不失準確度。
- 3
注意力殘差打破層級壁壘:93層分8段,每段前三層用筆記層(KDA)、最後一層用完整注意力(Gated MOA)做總校隊。每層可直接回頭調用前面任意層的原始特徵,成本只增加不足一層計算量,防止信息在層層傳遞中丟失。
- 4
全棧低精度與防護性後訓練:MXF2低精度從訓練第一步開始(非事後壓縮),權重減75%。後訓練分三步:SFT標準範本、強化學習訓練9個領域專家、多教師蒸餾濃縮成一個模型。用三層防護防獎勵黑客:思考預算超期倒扣、評分表強制先寫、沙盒隔離工具調用。
實用技巧與重點
乾貨- 結構數據
- 總參數量:2.78T(上代1T)
- 激活參數:100B(占比3.6%)
- 混合專家數:900位(上代300多位)
- 每次激活:16位醫生(上代8位)
- 層數:93層(上代61層)
- 上下文長度:100萬token
- 技術創新
- Stable Latent MoE(信息壓縮50%再分派)
- Quantile Balancing(防止單一名醫擁擠)
- Side 2 GLU(信號限制器)
- KDA線性注意力(筆記式讀法)
- NoPE位置編碼取消
- Attention Residuals(注意力殘差)
- Gated MOA(門控多頭注意力)
- MXF2低精度格式
- 投機解碼(Speculative Decoding)
- 效能指標
- 同算力換2.5倍智能(官方數據)
- 權重體積:減75%(4分之1)
- 最小部署需求:8台伺服器串聯
- 第三方評分(Artificial Analysis):第3名(與Opus 4.8、GPT-5.5同級)
- 成本約為Opus 4.8的一半
- 訓練方案
- 優化器:Purhead Moon(分組獨立更新)
- 原生多模態設計(文字+影像同步訓練)
- 讀長訓練課程:短→中→長→100萬token
- 後訓練專家數:9個(3領域×3思考力度)
- 多教師蒸餾(MOPD):on-policy學習(老師根據學生當下的作業修正,而非只給範本)
- 可用工具調用
- 連續呼叫工具數百到上千次
- 運行於沙盒虛擬機(失敗不影響外部系統)
- 負面指標與代價
- 幻覺率:50%(上代40%,反而更高)
- 價格:調至Claude Sonnet等級(中文模型低價優勢消失)
- 思考成本計費:簡單繪圖任務實測1.3萬token
- 基礎模型(Base):未開源
- 授權限制:年營收超2千萬美元或活躍用戶超1億需另外處理
結論
結論“Kimi K3最值得學的不是參數大小,而是每個地方都在算同一筆帳,用工程精細度把開源與最強閉源的差距從6-9個月壓到3-5個月,但精致有代價——幻覺升高、價格攀升、基礎模型保留——需要理性評估準確度與成本的取捨。”
完整解析
詳細Kimi K3在7月16日上線API,7月27日開放權重與完整技術報告,成為首個將線性注意力從實驗室(48B)直接搬到量產規模(2.78T)的前沿開源模型。看起來像是簡單的參數增加,實則隱藏了一套完整的工程折衷哲學。
第一層折衷在架構。傳統的擴大模型等同擴大成本,K3用混合專家(MoE)架構反轉這個直覺:900個專科醫生分散部署,但掛號系統每次只喚醒16位最對症的,其餘時間休眠。實際被激活的參數只有100多億,占總參數的3.6%。但光有MoE還不夠,多個專家分散在不同機器時,病例在他們之間傳來傳去的通訊成本會吃掉大量時間。K3的Stable Latent MoE先把病例壓成重點(寬度從100%降到50%),專科醫生在這條比較窄的側廳完成分派,只有通財醫生(全知層)拿到完整版。為了防止所有人都掛同一位名醫,K3加了Quantile Balancing讓900位醫生的工作量攤平;再加Side 2 GLU信號限制器,確保訊號再怎麼衝都被平滑壓在上限內。
第二層折衷在讀文本的方式。傳統注意力機制像一位讀者每讀一句新的都得從第一頁把整本書翻一遍,長文本越來越慢越來越貴。K3採用去年月之暗面在論文《Kimi Linear》裡驗證過的線性注意力(KDA),改成邊讀邊用筆記記關鍵信息,新句子只需更新筆記。這套筆記法內建兩個機制:Delta Rule發現記錯了會回頭改正,逐通道遺忘門讓每種信息有自己的保存期限。但純筆記會漏細節,所以K3沒有選邊站,而是用了Attention Residuals設計:93層分成八段,每段是三層筆記層(KDA)加一層回看層(完整注意力Gated MOA)做總校隊。這個3:1組合貫穿全模型,讓每層都能直接翻回前面任意層的原始特徵,避免信息在層層傳遞中被揉掉。訓練成本只增加不到一層的計算量,推理階段幾乎無感。
更激進的是位置編碼的取消(NoPE)。傳統模型給每個詞貼位置編號(RPE),但這套編號是照原本設定長度做的,想讀更長就得拉開持印加修正,讀到很後面往往失準。K3直接不加位置編碼,而是靠筆記程序本身——越舊的內容自然越淡,這個淡化過程本身就帶著先後順序。這樣做的威力在於,訓練時直接把一次能讀的長度推到100萬token,約等於一整套長篇小說鋪在桌上。
第三層折衷在硬體成本。過去常見做法是用高精度訓練再事後量化,但K3反過來——從訓練第一步就用MXF2低精度格式,讓身體從小穿著比賽裝練習。結果是同一份權重體積只剩原本的四分之一,最低部署門檻降到8台伺服器串在一起。還加了投機解碼優化——先大膽猜接下來幾個字再讓主模型驗證,像手機打字的自動補完。
後訓練環節展示了另一種工程風格。K3先用SFT按人寫好的範例學怎麼回答,但沒有只練一個模型,而是分成三個領域,每個領域配三種思考力度,產生九個各有專長的專家。第三步才是多教師蒸餾(MOPD),九位專家各自濃縮本事交給同一個學生。關鍵是on-policy方式:學生先用自己的打法做一遍,老師針對他當下寫出來的東西給修正,而不是叫他照抄範本。
防獎勵黑客是最精妙的部分。給分數模型就會找分數的漏洞,K3設了三道關卡:第一道給思考長度定預算,想太久超出預算就倒扣,久而久之模型自己學會根據題目難度調整;第二道評分方式強制AI評審先寫出評分表再打分數,避免被長空洞答案帶著走,用錦標賽制而非絕對分數;第三道把所有工具操作隔離在沙盒虛擬機,可連續呼叫數百上千次工具而不會弄壞外部系統。
所有這些設計聚焦一個方向:混合專家省規模、線性注意力省長度、低精度省部署、投機解碼省時間,省下來的每一分都喂回更大的基礎模型和更長的強化學習。官方說法是單位算力換2.5倍智能。第三方評測(Artificial Analysis)把它排在閉源模型Opus 4.8和GPT-5.5同一級,成本約為Opus的一半。Nathan Lambert(《Interconnect》作者)直言這是Deep Seek R1以來開放模型最接近前沿的一次,開放與閉源的差距從6-9個月縮到3-5個月。
但代價也很清楚。幻覺率反而升高到50%(上代40%),打得更漂亮卻更會唬人。價格從低成本優勢猛然跳到Claude Sonnet等級,Simon Willison直白地說中文模型的低價優勢正在消失。思考過程產生的token也要算錢,實測一張簡單的圖就燒掉1.3萬token。最後,基礎模型(Base)沒有開源,只有MIT授權的完整版;想做雲端服務年營收超2千萬美元或產品活躍用戶超1億得另外處理。官方也承認模型有時過度主動把好的壞的都放進來。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


