KeyFrame內部研究專用

打開 Kimi K3:開源架構與做法全解析

Jim AI Notebook·7月30日週四·15 min中文

三句話摘要

Kimi K3的工程哲學:如何用3倍參數卻不成比例成長的成本來縮小開源與閉源模型的差距 Kimi K3最值得學的不是參數大小,而是每個地方都在算同一筆帳,用工程精細度把開源與最強閉源的差距從6-9個月壓到3-5個月,但精致有代價——幻覺升高、價格攀升、基礎模型保留——需要理性評估準確度與成本的取捨。 混合專家的克制設計:900個專科醫生只每次叫醒16位,其餘休眠。透過Stable Latent MoE將信息壓縮再分派、Quantile Balancing均衡負載、Side 2 GLU平滑信號,讓大規模不必等於大成本。

重點整理

重點
  • 1

    混合專家的克制設計:900個專科醫生只每次叫醒16位,其餘休眠。透過Stable Latent MoE將信息壓縮再分派、Quantile Balancing均衡負載、Side 2 GLU平滑信號,讓大規模不必等於大成本。

  • 2

    線性注意力取代全注意力:K3採用去年才實驗驗證的KDA(Kimi Delta Attention),改用「筆記法」邊讀邊記,新句只需更新筆記,跳過傳統的全文重新比對。搭配完全取消位置編碼(NoPE),讓閱讀長度能推到100萬token而不失準確度。

  • 3

    注意力殘差打破層級壁壘:93層分8段,每段前三層用筆記層(KDA)、最後一層用完整注意力(Gated MOA)做總校隊。每層可直接回頭調用前面任意層的原始特徵,成本只增加不足一層計算量,防止信息在層層傳遞中丟失。

  • 4

    全棧低精度與防護性後訓練:MXF2低精度從訓練第一步開始(非事後壓縮),權重減75%。後訓練分三步:SFT標準範本、強化學習訓練9個領域專家、多教師蒸餾濃縮成一個模型。用三層防護防獎勵黑客:思考預算超期倒扣、評分表強制先寫、沙盒隔離工具調用。

實用技巧與重點

乾貨
  • 結構數據
  • 總參數量:2.78T(上代1T)
  • 激活參數:100B(占比3.6%)
  • 混合專家數:900位(上代300多位)
  • 每次激活:16位醫生(上代8位)
  • 層數:93層(上代61層)
  • 上下文長度:100萬token
  • 技術創新
  • Stable Latent MoE(信息壓縮50%再分派)
  • Quantile Balancing(防止單一名醫擁擠)
  • Side 2 GLU(信號限制器)
  • KDA線性注意力(筆記式讀法)
  • NoPE位置編碼取消
  • Attention Residuals(注意力殘差)
  • Gated MOA(門控多頭注意力)
  • MXF2低精度格式
  • 投機解碼(Speculative Decoding)
  • 效能指標
  • 同算力換2.5倍智能(官方數據)
  • 權重體積:減75%(4分之1)
  • 最小部署需求:8台伺服器串聯
  • 第三方評分(Artificial Analysis):第3名(與Opus 4.8、GPT-5.5同級)
  • 成本約為Opus 4.8的一半
  • 訓練方案
  • 優化器:Purhead Moon(分組獨立更新)
  • 原生多模態設計(文字+影像同步訓練)
  • 讀長訓練課程:短→中→長→100萬token
  • 後訓練專家數:9個(3領域×3思考力度)
  • 多教師蒸餾(MOPD):on-policy學習(老師根據學生當下的作業修正,而非只給範本)
  • 可用工具調用
  • 連續呼叫工具數百到上千次
  • 運行於沙盒虛擬機(失敗不影響外部系統)
  • 負面指標與代價
  • 幻覺率:50%(上代40%,反而更高)
  • 價格:調至Claude Sonnet等級(中文模型低價優勢消失)
  • 思考成本計費:簡單繪圖任務實測1.3萬token
  • 基礎模型(Base):未開源
  • 授權限制:年營收超2千萬美元或活躍用戶超1億需另外處理

結論

結論

Kimi K3最值得學的不是參數大小,而是每個地方都在算同一筆帳,用工程精細度把開源與最強閉源的差距從6-9個月壓到3-5個月,但精致有代價——幻覺升高、價格攀升、基礎模型保留——需要理性評估準確度與成本的取捨。

完整解析

詳細

Kimi K3在7月16日上線API,7月27日開放權重與完整技術報告,成為首個將線性注意力從實驗室(48B)直接搬到量產規模(2.78T)的前沿開源模型。看起來像是簡單的參數增加,實則隱藏了一套完整的工程折衷哲學。

第一層折衷在架構。傳統的擴大模型等同擴大成本,K3用混合專家(MoE)架構反轉這個直覺:900個專科醫生分散部署,但掛號系統每次只喚醒16位最對症的,其餘時間休眠。實際被激活的參數只有100多億,占總參數的3.6%。但光有MoE還不夠,多個專家分散在不同機器時,病例在他們之間傳來傳去的通訊成本會吃掉大量時間。K3的Stable Latent MoE先把病例壓成重點(寬度從100%降到50%),專科醫生在這條比較窄的側廳完成分派,只有通財醫生(全知層)拿到完整版。為了防止所有人都掛同一位名醫,K3加了Quantile Balancing讓900位醫生的工作量攤平;再加Side 2 GLU信號限制器,確保訊號再怎麼衝都被平滑壓在上限內。

第二層折衷在讀文本的方式。傳統注意力機制像一位讀者每讀一句新的都得從第一頁把整本書翻一遍,長文本越來越慢越來越貴。K3採用去年月之暗面在論文《Kimi Linear》裡驗證過的線性注意力(KDA),改成邊讀邊用筆記記關鍵信息,新句子只需更新筆記。這套筆記法內建兩個機制:Delta Rule發現記錯了會回頭改正,逐通道遺忘門讓每種信息有自己的保存期限。但純筆記會漏細節,所以K3沒有選邊站,而是用了Attention Residuals設計:93層分成八段,每段是三層筆記層(KDA)加一層回看層(完整注意力Gated MOA)做總校隊。這個3:1組合貫穿全模型,讓每層都能直接翻回前面任意層的原始特徵,避免信息在層層傳遞中被揉掉。訓練成本只增加不到一層的計算量,推理階段幾乎無感。

更激進的是位置編碼的取消(NoPE)。傳統模型給每個詞貼位置編號(RPE),但這套編號是照原本設定長度做的,想讀更長就得拉開持印加修正,讀到很後面往往失準。K3直接不加位置編碼,而是靠筆記程序本身——越舊的內容自然越淡,這個淡化過程本身就帶著先後順序。這樣做的威力在於,訓練時直接把一次能讀的長度推到100萬token,約等於一整套長篇小說鋪在桌上。

第三層折衷在硬體成本。過去常見做法是用高精度訓練再事後量化,但K3反過來——從訓練第一步就用MXF2低精度格式,讓身體從小穿著比賽裝練習。結果是同一份權重體積只剩原本的四分之一,最低部署門檻降到8台伺服器串在一起。還加了投機解碼優化——先大膽猜接下來幾個字再讓主模型驗證,像手機打字的自動補完。

後訓練環節展示了另一種工程風格。K3先用SFT按人寫好的範例學怎麼回答,但沒有只練一個模型,而是分成三個領域,每個領域配三種思考力度,產生九個各有專長的專家。第三步才是多教師蒸餾(MOPD),九位專家各自濃縮本事交給同一個學生。關鍵是on-policy方式:學生先用自己的打法做一遍,老師針對他當下寫出來的東西給修正,而不是叫他照抄範本。

防獎勵黑客是最精妙的部分。給分數模型就會找分數的漏洞,K3設了三道關卡:第一道給思考長度定預算,想太久超出預算就倒扣,久而久之模型自己學會根據題目難度調整;第二道評分方式強制AI評審先寫出評分表再打分數,避免被長空洞答案帶著走,用錦標賽制而非絕對分數;第三道把所有工具操作隔離在沙盒虛擬機,可連續呼叫數百上千次工具而不會弄壞外部系統。

所有這些設計聚焦一個方向:混合專家省規模、線性注意力省長度、低精度省部署、投機解碼省時間,省下來的每一分都喂回更大的基礎模型和更長的強化學習。官方說法是單位算力換2.5倍智能。第三方評測(Artificial Analysis)把它排在閉源模型Opus 4.8和GPT-5.5同一級,成本約為Opus的一半。Nathan Lambert(《Interconnect》作者)直言這是Deep Seek R1以來開放模型最接近前沿的一次,開放與閉源的差距從6-9個月縮到3-5個月。

但代價也很清楚。幻覺率反而升高到50%(上代40%),打得更漂亮卻更會唬人。價格從低成本優勢猛然跳到Claude Sonnet等級,Simon Willison直白地說中文模型的低價優勢正在消失。思考過程產生的token也要算錢,實測一張簡單的圖就燒掉1.3萬token。最後,基礎模型(Base)沒有開源,只有MIT授權的完整版;想做雲端服務年營收超2千萬美元或產品活躍用戶超1億得另外處理。官方也承認模型有時過度主動把好的壞的都放進來。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。