KeyFrame內部研究專用

China's Models No Longer Need Western Hardware

Prompt Engineering·7月2日週四·11 min英文

三句話摘要

中國公司 Muthon 用自製芯片訓練 1.6 兆參數模型,無需 NVIDIA 或 Google 硬件,打破訓練超大規模 AI 模型的必要條件。 Longcat 2.0 的真正突破不在超大參數,而在於用演算法優化和自主軟件棧證明了訓練前沿模型不再是 NVIDIA 的專利。 規模突破來自演算法優化,非單純增加專家:傳統做法是用混合專家(MoE)架構堆砌參數,但增加專家數量會遭遇遞減報酬。Longcat 改用 n-grams embeddings(結合 2-5 個詞的組合),用更廉價的字典擴展替代昂貴的專家訓練,降低整體計算成本。

重點整理

重點
  • 1

    規模突破來自演算法優化,非單純增加專家:傳統做法是用混合專家(MoE)架構堆砌參數,但增加專家數量會遭遇遞減報酬。Longcat 改用 n-grams embeddings(結合 2-5 個詞的組合),用更廉價的字典擴展替代昂貴的專家訓練,降低整體計算成本。

  • 2

    稀疏注意機制的實用化才是關鍵:標準注意力對長文本極耗資源,稀疏注意只看相關部分。但選擇「哪部分相關」的輔助模型本身會成為性能瓶頸,Longcat 通過順序讀取記憶、跨層復用查詢結果、兩階段篩選,將昂貴部分變便宜。

  • 3

    推測解碼降低延遲,優化硬件利用:用輕量級草稿模型快速生成候選,再用大模型修正,配合自定義芯片的不同優化方向(預填 prefill 要算力,解碼 decode 要帶寬),最大化 50,000+ 芯片的效率。

  • 4

    軟件棧才是真正護城河:NVIDIA 的強大不只在硬件速度,而是 CUDA 經年積累的生態。Longcat 從零構建自定義芯片適配層,這種系統性工程能力決定了競爭力。

實用技巧與重點

乾貨
  • 模型規格:1.6 兆參數,48 億活躍參數/token,35 兆+ token 訓練文本
  • 硬件:50,000+ 自定義 AI 芯片(非 NVIDIA H100、Google TPU)
  • 技術堆棧
  • Embeddings:n-grams(2-5 詞組合)而非單詞
  • 注意機制:修改版 DSA(DeepSeek Sparse Attention)
  • 解碼優化:輕量級選擇器 + 推測解碼
  • 訪問方式:OpenRouter 上線(名稱 Aval Alpha);longcat.chat demo;Hugging Face 權重待上傳
  • API 定價:價格相對西方前沿模型更優惠
  • 能力:文本 only(如 GPT o1 類似限制),基准性能與 OpenAI、Google、Anthropic 相當

結論

結論

Longcat 2.0 的真正突破不在超大參數,而在於用演算法優化和自主軟件棧證明了訓練前沿模型不再是 NVIDIA 的專利。

完整解析

詳細

開訓一個兆級參數的大語言模型,過去被認為只有 NVIDIA 和 Google 這類掌握尖端芯片與軟件生態的企業才能做到。但 Muthon——一家中國食品及雜貨配送公司——剛剛用自製芯片做出了 Longcat 2.0,徹底改變這個認知。

問題的核心在於:大模型訓練的預算由兩部分組成——參數數量決定模型規模,計算量決定每個 token 的處理工作。過去的策略是盡量堆砌混合專家(MoE)架構來增加參數,但講者指出這會踩到遞減報酬的陷阱——專家太多反而降低精度。Longcat 的創新在於將重點從「增加專家」轉向「優化 embeddings」,用 n-grams(詞的多元組合)替代單詞 embeddings,這樣雖然擴大了詞庫,但字典查詢遠比訓練新專家便宜。

然而,長文本帶來的注意力機制成本隨之而來。傳統注意力對百萬 token 的文本要逐個檢查,計算量爆炸。稀疏注意機制雖然只看相關部分,但用來選擇「哪些相關」的輔助模型本身又成為新瓶頸。Longcat 的解決方案分三層:讀取記憶時用整潔的塊狀訪問而非隨機跳躍、在模型的多個層級複用一次的選擇結果(類似緩存)、先粗看再精看。這三個優化把昂貴的注意力變成可承受的成本。

在推測解碼層面,Longcat 借鑑 DeepSeek 的思路,用輕量級「草稿網絡」快速生成候選結果,再交由大模型驗證修正,這降低了端到端延遲。整個系統設計的前提是充分發揮自製芯片的特性:預填階段(處理提示詞)是計算密集,需要高算力;解碼階段(生成答案)是記憶密集,需要高帶寬。Longcat 用定製芯片為兩個環節分別優化。

訓練規模是 50,000+ 自定義 AI 芯片,總共攝入 35 兆+ token 文本。看似龐大的數字,但最重要的故事不在硬件數量,而在軟件棧——NVIDIA 之所以統治這個領域,硬件只是表面,CUDA 多年積累的優化、編譯器、調試工具才是護城河。Longcat 從零開始為自製芯片構建了一套完整的軟件生態,在沒有 CUDA 的約束下打造出與 OpenAI、Google、Anthropic 前沿模型相當的能力。這證明了在現實的演算法優化和工程努力下,中國企業可以減少對美國硬件的依賴。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。