China's Models No Longer Need Western Hardware
三句話摘要
中國公司 Muthon 用自製芯片訓練 1.6 兆參數模型,無需 NVIDIA 或 Google 硬件,打破訓練超大規模 AI 模型的必要條件。 Longcat 2.0 的真正突破不在超大參數,而在於用演算法優化和自主軟件棧證明了訓練前沿模型不再是 NVIDIA 的專利。 規模突破來自演算法優化,非單純增加專家:傳統做法是用混合專家(MoE)架構堆砌參數,但增加專家數量會遭遇遞減報酬。Longcat 改用 n-grams embeddings(結合 2-5 個詞的組合),用更廉價的字典擴展替代昂貴的專家訓練,降低整體計算成本。
重點整理
重點- 1
規模突破來自演算法優化,非單純增加專家:傳統做法是用混合專家(MoE)架構堆砌參數,但增加專家數量會遭遇遞減報酬。Longcat 改用 n-grams embeddings(結合 2-5 個詞的組合),用更廉價的字典擴展替代昂貴的專家訓練,降低整體計算成本。
- 2
稀疏注意機制的實用化才是關鍵:標準注意力對長文本極耗資源,稀疏注意只看相關部分。但選擇「哪部分相關」的輔助模型本身會成為性能瓶頸,Longcat 通過順序讀取記憶、跨層復用查詢結果、兩階段篩選,將昂貴部分變便宜。
- 3
推測解碼降低延遲,優化硬件利用:用輕量級草稿模型快速生成候選,再用大模型修正,配合自定義芯片的不同優化方向(預填 prefill 要算力,解碼 decode 要帶寬),最大化 50,000+ 芯片的效率。
- 4
軟件棧才是真正護城河:NVIDIA 的強大不只在硬件速度,而是 CUDA 經年積累的生態。Longcat 從零構建自定義芯片適配層,這種系統性工程能力決定了競爭力。
實用技巧與重點
乾貨- 模型規格:1.6 兆參數,48 億活躍參數/token,35 兆+ token 訓練文本
- 硬件:50,000+ 自定義 AI 芯片(非 NVIDIA H100、Google TPU)
- 技術堆棧:
- Embeddings:n-grams(2-5 詞組合)而非單詞
- 注意機制:修改版 DSA(DeepSeek Sparse Attention)
- 解碼優化:輕量級選擇器 + 推測解碼
- 訪問方式:OpenRouter 上線(名稱 Aval Alpha);longcat.chat demo;Hugging Face 權重待上傳
- API 定價:價格相對西方前沿模型更優惠
- 能力:文本 only(如 GPT o1 類似限制),基准性能與 OpenAI、Google、Anthropic 相當
結論
結論“Longcat 2.0 的真正突破不在超大參數,而在於用演算法優化和自主軟件棧證明了訓練前沿模型不再是 NVIDIA 的專利。”
完整解析
詳細開訓一個兆級參數的大語言模型,過去被認為只有 NVIDIA 和 Google 這類掌握尖端芯片與軟件生態的企業才能做到。但 Muthon——一家中國食品及雜貨配送公司——剛剛用自製芯片做出了 Longcat 2.0,徹底改變這個認知。
問題的核心在於:大模型訓練的預算由兩部分組成——參數數量決定模型規模,計算量決定每個 token 的處理工作。過去的策略是盡量堆砌混合專家(MoE)架構來增加參數,但講者指出這會踩到遞減報酬的陷阱——專家太多反而降低精度。Longcat 的創新在於將重點從「增加專家」轉向「優化 embeddings」,用 n-grams(詞的多元組合)替代單詞 embeddings,這樣雖然擴大了詞庫,但字典查詢遠比訓練新專家便宜。
然而,長文本帶來的注意力機制成本隨之而來。傳統注意力對百萬 token 的文本要逐個檢查,計算量爆炸。稀疏注意機制雖然只看相關部分,但用來選擇「哪些相關」的輔助模型本身又成為新瓶頸。Longcat 的解決方案分三層:讀取記憶時用整潔的塊狀訪問而非隨機跳躍、在模型的多個層級複用一次的選擇結果(類似緩存)、先粗看再精看。這三個優化把昂貴的注意力變成可承受的成本。
在推測解碼層面,Longcat 借鑑 DeepSeek 的思路,用輕量級「草稿網絡」快速生成候選結果,再交由大模型驗證修正,這降低了端到端延遲。整個系統設計的前提是充分發揮自製芯片的特性:預填階段(處理提示詞)是計算密集,需要高算力;解碼階段(生成答案)是記憶密集,需要高帶寬。Longcat 用定製芯片為兩個環節分別優化。
訓練規模是 50,000+ 自定義 AI 芯片,總共攝入 35 兆+ token 文本。看似龐大的數字,但最重要的故事不在硬件數量,而在軟件棧——NVIDIA 之所以統治這個領域,硬件只是表面,CUDA 多年積累的優化、編譯器、調試工具才是護城河。Longcat 從零開始為自製芯片構建了一套完整的軟件生態,在沒有 CUDA 的約束下打造出與 OpenAI、Google、Anthropic 前沿模型相當的能力。這證明了在現實的演算法優化和工程努力下,中國企業可以減少對美國硬件的依賴。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


