MiniMax M3: Rivals Opus, 17x Cheaper, Fully Open!
三句話摘要
Minimax M3 開權重模型發布評測:結合稀疏注意力、原生多模態與百萬 Token 上下文,性能接近最強商用模型且價格便宜一倍。 Minimax M3 首次證明開權重模型可在價格優勢下達成與頂級商用模型相當的長上下文與編碼性能,其 MSA 架構與原生多模態設計值得關注,特別適合長地平線代理與成本敏感的應用場景。 MSA 稀疏注意力架構:不讓每個 token 看遍全部 token,而是評分內容塊並只在重要部分執行注意力,實現百萬級上下文而無速度衰減,使長地平線代理和大型程式碼專案成為可能。
重點整理
重點- 1
MSA 稀疏注意力架構:不讓每個 token 看遍全部 token,而是評分內容塊並只在重要部分執行注意力,實現百萬級上下文而無速度衰減,使長地平線代理和大型程式碼專案成為可能。
- 2
原生多模態設計:文字和圖像從預訓練初期就一起訓練(超過 100 萬億 tokens),使兩者在相同特徵空間內,模型可在同一推理路徑上理解圖像結構與相鄰文字,形填測試中能精確座標計算後填表。
- 3
基準測試全面領先:軟體工程基準 59%(超 GPT-4.5、Gemini 3.1 Pro),Terminal Bench 66%、MCP Atlas 74%、Browser Comp 83.5%(超 Opus),證明開權重模型首次在多個關鍵基準上打敗商用最強模型。
- 4
長地平線自主能力驗證:無人介入下完成 24 小時 CUDA 核心優化(利用率 7.6%→71.3%),12 小時內複現 ICLR 2025 論文,自行執行資料合成、模型訓練、評估與迭代,超越傳統代理在數十步後就墜落的瓶頸。
實用技巧與重點
乾貨- Model 名稱:Minimax M3
- 上下文窗口:100 萬 token(最低保證 512k)
- 架構:MSA(Minimax Sparse Attention)
- 多模態:原生支援文字、圖像、語音、音樂
- 基準成績:
- 軟體工程基準 Pro:59%
- Terminal Bench 2.1:66%
- MCP Atlas:74%
- Browser Comp:83.5%
- SVG Bench、Kernel Bench Hard、OS World:超 Opus 和 GPT-4.5
- 定價(50% 折扣期間):
- 輸入:$0.3/百萬 tokens
- 輸出:$1/百萬 tokens
- $20 月費套餐:約 17 億 M3 tokens
- 額外 12% 折扣(本影片贊助商優惠)
- API 相容性:OpenAI、Anthropic SDK 相容,支援 curl、程式碼平台、VS Code、Cursor、Codex
- CUDA 優化案例:147 個基準提交、1,900+ 次呼叫、9.4 倍效能提升(7.6%→71.3% 硬體利用率)
- 論文複現案例:12 小時、18 次提交、完整複現 ICLR 2025 核心實驗
- 自訓練案例:在 Post-trained Bench 排名第三(僅次 Opus 4.7、GPT-4.5)
- 發佈時程:完整技術報告與開權重版本 10 天後發佈
- 網址:universeofai.bihive.com(新聞通訊)
結論
結論“Minimax M3 首次證明開權重模型可在價格優勢下達成與頂級商用模型相當的長上下文與編碼性能,其 MSA 架構與原生多模態設計值得關注,特別適合長地平線代理與成本敏感的應用場景。”
完整解析
詳細Minimax 團隊發布了 M3 模型,這是首個開權重模型同時結合三項前沿能力:編碼、代理工作流與百萬 token 上下文窗口。最令人驚訝的是價格——在 50% 折扣期間,輸入成本只需 $0.3 每百萬 tokens,遠低於 Opus 和 GPT-4.5,卻在多個基準上與它們正面競爭。
M3 的核心優勢源於 MSA(Minimax Sparse Attention)稀疏注意力架構。傳統注意力機制讓每個 token 檢視序列中的所有其他 token,導致計算成本與上下文長度成平方關係,處理長文本時速度急劇下降。MSA 改變這一點:它對內容塊進行評分,只關注重要部分執行注意力運算,因此能保持百萬級上下文窗口(最低保證 512k)而無速度衰減。這對長地平線代理、大型程式碼專案與冗長文件/影片理解至關重要。
多模態設計同樣獨特。多數模型透過在完成的文字模型上接合獨立圖像編碼器來獲得視覺能力;Minimax 則從預訓練初期就將文字與圖像一起擴展至超過 100 萬億 tokens,使兩種模式在相同特徵空間內。結果是模型可在同一推理路徑上處理圖像與相鄰文字,而非在末端進行橋接。形填測試顯示它能理解影像結構,自動計算座標後才寫入——這種對版面的structural理解超越單純描述。
基準測試表現令人矚目。軟體工程基準 Pro 59%,超越 GPT-4.5 和 Gemini 3.1 Pro,接近 Opus;Terminal Bench 2.1 66%,MCP Atlas 74%,Browser Comp 83.5% 超越 Opus 4.7。更重要的是,開權重模型首次在 Browser Comp、SVG Bench、Kernel Bench Hard 和 OS World 等多個基準上打敗商用最強模型——這在以往並不常見。
講者展示的長地平線任務驗證更令人印象深刻。在無人干預下,M3 完成了 24 小時的 CUDA 核心優化任務,提交 147 個基準版本、近 2,000 次函式呼叫,將硬體利用率從 7.6% 提升至 71.3%,達成 9.4 倍加速。它在 12 小時內從零開始複現 ICLR 2025 論文,執行 18 次提交並成功複現核心實驗,同時利用多模態能力直接從論文圖表讀取資料、用百萬 token 視窗同時保持紙本和程式碼。在 Post-trained Bench(模型需自行執行資料合成、訓練、評估與迭代的完整管線)中排名第三,僅次於 Opus 4.7 和 GPT-4.5。這些案例驗證的核心是長地平線連貫性——模型能否在數千步間維持狀態、從自身錯誤恢復,而不像傳統代理在二十步後就墜落。
實際生成範例也令人印象深刻。講者要求生成玻璃態形態設計儀表板,M3 產出專業品質的設計;新野蠻主義風格則加入動畫與一致的風格;SVG 日出日落動畫完全用程式碼生成、保持數學精度;軌道公司動畫標誌展示流暢互動;太陽系 3D 模擬可調整時間速度與縮放;布料模擬器可互動調整重力、剛度與風力。所有範例都是單次生成,展示模型一次過編碼複雜前端與互動功能的能力。
訂閱計劃包含文字、圖像、語音與音樂的共享 token 池,涵蓋整個模型家族而非僅 M3。$20 月費套餐提供約 17 億 M3 tokens,額外享 12% 折扣。API 與 OpenAI、Anthropic SDK 相容,可直接用於 Cursor、Codex 與常見開發工具。完整技術報告與開權重版本預計 10 天後發佈。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


