KeyFrame內部研究專用

四大开源模型都有谁 | OpenRouter | DeepSeek | GLM | MiniMax | Nemotron | 闭源模型 | AI降本 | 大模型选型

Best Partners TV·7月4日週六·11 min中文

三句話摘要

2026年最值得采用的4款开源大模型选型指南——性价比、任务能力、多模态与企业部署的完整对比。 開源和商業模型的差距已經足夠薄,核心決策應該從「能不能用」轉向「我的業務最看重什麼——極低成本、頂級任務規劃、原生多模態,還是企業級部署穩定性」,然後根據需求選型並在實際場景測試。 開源模型成本優勢已成決定性因素:開源和商業前沿模型能力差距穩定在3-6個月範圍,但成本相差數十倍,使得企業在業務負載量大時有動力轉向開源方案。這個論斷的核心意義在於,開源模型已不再是「玩具」或邊緣任務的選擇,而是具有工業級落地價值。

重點整理

重點
  • 1

    開源模型成本優勢已成決定性因素:開源和商業前沿模型能力差距穩定在3-6個月範圍,但成本相差數十倍,使得企業在業務負載量大時有動力轉向開源方案。這個論斷的核心意義在於,開源模型已不再是「玩具」或邊緣任務的選擇,而是具有工業級落地價值。

  • 2

    不同模型滿足差異化訴求:DeepSeek追求極致性價比,GLM 5.2追求任務規劃質量,MiniMax M3補充多模態空白,NVIDIA則強調企業部署穩定性。開發者應先釐清業務需求(成本優先或能力優先),而非盲目選擇。

  • 3

    推理成本隱藏陷阱需警惕:GLM 5.2和MiniMax M3的單位價格雖低,但因生成Token較多,實際總成本可能高於表面單價。成本控制需要在實際場景測試中才能評估準確。

  • 4

    政策和協議差異影響商用決策:資料隱私政策(如DeepSeek中國境內路由允許訓練)、開源協議類型(MIT vs MiniMax社區協議vs OpenMDW)都會影響商用可行性,選型時需提前規劃。

實用技巧與重點

乾貨
  • DeepSeek V4 Flash
  • 發布時間:2026年4月
  • 參數規模:總參數284B,激活參數130B(混合專家)
  • 上下文窗口:百萬Token
  • SweepBench評分:97%(與Pro版差距1.6%)
  • 官方API定價:輸入 $0.14/百萬Token(含緩存折扣可至$0.029),輸出 $0.28/百萬Token
  • 永久定價:5月固定
  • 輸出成本對比:約為GPT-4.5的1/150
  • 開源協議:MIT
  • 特點:技術向、代碼能力強,對Prompt要求高,文本風格控制一般,不支持圖像
  • GLM 5.2
  • 發布時間:2026年6月中旬
  • 發佈平台上線狀態:已被多個第三方平台火速上線
  • AI2測試排名:51分(開源第一),與Claude Sonnet 5差距5分
  • 加權平均價格:輸入 $0.447/百萬Token,輸出 $3.31/百萬Token
  • 推理速度:每秒78個Token
  • 開源協議:MIT
  • 特點:純文本模型,任務規劃卓越,代碼編寫質量高,思考過程消耗Token多,不支持圖像和視頻
  • MiniMax M3
  • 參數規模:總參數428B,激活參數230B(混合專家)
  • 上下文窗口:百萬Token
  • AI2智力指數:44分(與DeepSeek V4 Pro並列)
  • 加權平均價格:輸入 $0.098/百萬Token,輸出 $1.21/百萬Token(超過512K上下文會上浮)
  • 技術創新:自研分塊吸收注意力機制
  • 開源協議:MiniMax社區協議(商用需署名,大型商用需書面授權)
  • 特點:原生多模態(圖像、圖表、視頻),上下文長度長,純代碼能力弱於GLM 5.2
  • NVIDIA NIM Llama Ultra
  • 參數規模:總參數550B,激活參數550B(混合模型)
  • 架構融合:Llama2 + Transformer,採用NVFP4精度
  • AI2智力指數:48分(開源第二)
  • 加權平均價格:輸入 $0.423/百萬Token,輸出 $2.61/百萬Token
  • 免費測試通道:可用於測試和體驗,不可用於商業產品
  • 開源協議:OpenMDW
  • 開源內容範圍:模型權重、訓練數據、訓練配方、評估工具、強化學習技術設施
  • 特點:純文本模型,不支持多模態,部署效率高,生態適配性強

結論

結論

開源和商業模型的差距已經足夠薄,核心決策應該從「能不能用」轉向「我的業務最看重什麼——極低成本、頂級任務規劃、原生多模態,還是企業級部署穩定性」,然後根據需求選型並在實際場景測試。

完整解析

詳細

過去十八個月,開源模型與商業前沿模型的能力差距一直維持在三到六個月的相對穩定狀態。這個觀察至關重要,因為它意味著開源模型的可行性已經不再是「能不能用」的問題,而是「該不該用」的經濟決策。當企業的AI調用量上升到一定規模時,從商業模型轉向開源所能節省的成本可能高達數十萬甚至上百萬元。在這樣的背景下,OpenRouter在2026年6月篩選出的四款開源模型就獲得了特殊的價值——它們代表著目前真正具備工業級落地價值的選項。

DeepSeek V4 Flash是跨越智能體落地分水嶺的第一個開源模型。所謂「跨越分水嶺」意指開發團隊可以直接將其應用於實際智能體工作流中,無需過度適配。Flash版本保留了Pro版絕大多數核心能力,同時將性價比推向極致。在DPC官方API上,其輸出成本僅為GPT-4.5的150分之一,且在2026年5月將這個定價固定為永久價格,直接打破了該能力檔位的模型定價天花板。然而使用者需要注意,這個模型更偏向技術向任務,對Prompt要求極高,語氣風格控制能力較弱。若業務需求是以極低成本運行企業級智能體或代碼任務,DeepSeek Flash是首選。

GLM 5.2在2026年6月中旬發布,迅速獲得行業認可。它在AI2測試中達到51分,穩居開源模型第一名,與Claude Sonnet 5的差距僅五分。相比DeepSeek的價格優勢,GLM 5.2的核心競爭力在於任務規劃質量和長周期代碼編寫能力。不過開發者需要警惕隱藏成本:GLM 5.2傾向於深入思考,會消耗更多輸出Token,導致實際總成本不如單價所示那麼低廉。此外,美國最近更新的出口管制新規迫使商業模型的海外訪問受限,這使得採用MIT協議、能力接近商業前沿的GLM 5.2價值凸顯——對於看重業務連續性的企業尤為關鍵。

MiniMax M3在四個模型中走了完全不同的路線——它是唯一原生支持圖像、圖表和視頻的開源大模型。在UI自動化測試、圖表解析或視頻工作流等多模態場景中,M3是目前開源生態的首選。雖然其纯文本分數略遜於GLM 5.2,但在真實多模態測試中表現已足以應對絕大多數場景。其自研的分塊吸收注意力機制允許它在保持合理成本的同時支撐長上下文。值得注意的是,M3採用MiniMax社區協議而非MIT,商用需署名,大型商用項目還需官方書面授權。

NVIDIA NIM Llama Ultra則是唯一美國本土出品的頭部開源模型,完全面向企業級部署設計。其核心差異化優勢不在極限跑分,而在部署效率與生態適配性。NVIDIA不僅開源了模型權重,還開源了訓練數據、訓練配方、評估工具和強化學習設施——這體現了英偉達的戰略邏輯:開源模型用戶越多,市場對其計算卡、服務、生態和企業AI方案的需求就越旺盛。選擇NVIDIA方案適合那些優先考慮運行速度、私有化部署、數據管控權和供應商背景的企業,尤其是長周期智能體、RAG系統或工作流編排場景。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。