KeyFrame內部研究專用

MiniMax M3: Rivals Opus, 17x Cheaper, Fully Open!

World of AI·6月2日週二·10 min英文

三句話摘要

Minimax M3 開權重模型發布評測:結合稀疏注意力、原生多模態與百萬 Token 上下文,性能接近最強商用模型且價格便宜一倍。 Minimax M3 首次證明開權重模型可在價格優勢下達成與頂級商用模型相當的長上下文與編碼性能,其 MSA 架構與原生多模態設計值得關注,特別適合長地平線代理與成本敏感的應用場景。 MSA 稀疏注意力架構:不讓每個 token 看遍全部 token,而是評分內容塊並只在重要部分執行注意力,實現百萬級上下文而無速度衰減,使長地平線代理和大型程式碼專案成為可能。

重點整理

重點
  • 1

    MSA 稀疏注意力架構:不讓每個 token 看遍全部 token,而是評分內容塊並只在重要部分執行注意力,實現百萬級上下文而無速度衰減,使長地平線代理和大型程式碼專案成為可能。

  • 2

    原生多模態設計:文字和圖像從預訓練初期就一起訓練(超過 100 萬億 tokens),使兩者在相同特徵空間內,模型可在同一推理路徑上理解圖像結構與相鄰文字,形填測試中能精確座標計算後填表。

  • 3

    基準測試全面領先:軟體工程基準 59%(超 GPT-4.5、Gemini 3.1 Pro),Terminal Bench 66%、MCP Atlas 74%、Browser Comp 83.5%(超 Opus),證明開權重模型首次在多個關鍵基準上打敗商用最強模型。

  • 4

    長地平線自主能力驗證:無人介入下完成 24 小時 CUDA 核心優化(利用率 7.6%→71.3%),12 小時內複現 ICLR 2025 論文,自行執行資料合成、模型訓練、評估與迭代,超越傳統代理在數十步後就墜落的瓶頸。

實用技巧與重點

乾貨
  • Model 名稱:Minimax M3
  • 上下文窗口:100 萬 token(最低保證 512k)
  • 架構:MSA(Minimax Sparse Attention)
  • 多模態:原生支援文字、圖像、語音、音樂
  • 基準成績
  • 軟體工程基準 Pro:59%
  • Terminal Bench 2.1:66%
  • MCP Atlas:74%
  • Browser Comp:83.5%
  • SVG Bench、Kernel Bench Hard、OS World:超 Opus 和 GPT-4.5
  • 定價(50% 折扣期間):
  • 輸入:$0.3/百萬 tokens
  • 輸出:$1/百萬 tokens
  • $20 月費套餐:約 17 億 M3 tokens
  • 額外 12% 折扣(本影片贊助商優惠)
  • API 相容性:OpenAI、Anthropic SDK 相容,支援 curl、程式碼平台、VS Code、Cursor、Codex
  • CUDA 優化案例:147 個基準提交、1,900+ 次呼叫、9.4 倍效能提升(7.6%→71.3% 硬體利用率)
  • 論文複現案例:12 小時、18 次提交、完整複現 ICLR 2025 核心實驗
  • 自訓練案例:在 Post-trained Bench 排名第三(僅次 Opus 4.7、GPT-4.5)
  • 發佈時程:完整技術報告與開權重版本 10 天後發佈
  • 網址:universeofai.bihive.com(新聞通訊)

結論

結論

Minimax M3 首次證明開權重模型可在價格優勢下達成與頂級商用模型相當的長上下文與編碼性能,其 MSA 架構與原生多模態設計值得關注,特別適合長地平線代理與成本敏感的應用場景。

完整解析

詳細

Minimax 團隊發布了 M3 模型,這是首個開權重模型同時結合三項前沿能力:編碼、代理工作流與百萬 token 上下文窗口。最令人驚訝的是價格——在 50% 折扣期間,輸入成本只需 $0.3 每百萬 tokens,遠低於 Opus 和 GPT-4.5,卻在多個基準上與它們正面競爭。

M3 的核心優勢源於 MSA(Minimax Sparse Attention)稀疏注意力架構。傳統注意力機制讓每個 token 檢視序列中的所有其他 token,導致計算成本與上下文長度成平方關係,處理長文本時速度急劇下降。MSA 改變這一點:它對內容塊進行評分,只關注重要部分執行注意力運算,因此能保持百萬級上下文窗口(最低保證 512k)而無速度衰減。這對長地平線代理、大型程式碼專案與冗長文件/影片理解至關重要。

多模態設計同樣獨特。多數模型透過在完成的文字模型上接合獨立圖像編碼器來獲得視覺能力;Minimax 則從預訓練初期就將文字與圖像一起擴展至超過 100 萬億 tokens,使兩種模式在相同特徵空間內。結果是模型可在同一推理路徑上處理圖像與相鄰文字,而非在末端進行橋接。形填測試顯示它能理解影像結構,自動計算座標後才寫入——這種對版面的structural理解超越單純描述。

基準測試表現令人矚目。軟體工程基準 Pro 59%,超越 GPT-4.5 和 Gemini 3.1 Pro,接近 Opus;Terminal Bench 2.1 66%,MCP Atlas 74%,Browser Comp 83.5% 超越 Opus 4.7。更重要的是,開權重模型首次在 Browser Comp、SVG Bench、Kernel Bench Hard 和 OS World 等多個基準上打敗商用最強模型——這在以往並不常見。

講者展示的長地平線任務驗證更令人印象深刻。在無人干預下,M3 完成了 24 小時的 CUDA 核心優化任務,提交 147 個基準版本、近 2,000 次函式呼叫,將硬體利用率從 7.6% 提升至 71.3%,達成 9.4 倍加速。它在 12 小時內從零開始複現 ICLR 2025 論文,執行 18 次提交並成功複現核心實驗,同時利用多模態能力直接從論文圖表讀取資料、用百萬 token 視窗同時保持紙本和程式碼。在 Post-trained Bench(模型需自行執行資料合成、訓練、評估與迭代的完整管線)中排名第三,僅次於 Opus 4.7 和 GPT-4.5。這些案例驗證的核心是長地平線連貫性——模型能否在數千步間維持狀態、從自身錯誤恢復,而不像傳統代理在二十步後就墜落。

實際生成範例也令人印象深刻。講者要求生成玻璃態形態設計儀表板,M3 產出專業品質的設計;新野蠻主義風格則加入動畫與一致的風格;SVG 日出日落動畫完全用程式碼生成、保持數學精度;軌道公司動畫標誌展示流暢互動;太陽系 3D 模擬可調整時間速度與縮放;布料模擬器可互動調整重力、剛度與風力。所有範例都是單次生成,展示模型一次過編碼複雜前端與互動功能的能力。

訂閱計劃包含文字、圖像、語音與音樂的共享 token 池,涵蓋整個模型家族而非僅 M3。$20 月費套餐提供約 17 億 M3 tokens,額外享 12% 折扣。API 與 OpenAI、Anthropic SDK 相容,可直接用於 Cursor、Codex 與常見開發工具。完整技術報告與開權重版本預計 10 天後發佈。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。