DeepSeek V4 Pro发布,价格不到Fable的2% | 撞车Grok 4.6 | Qwen3.8开放权重 | MOE | 长上下文 | 开源大模型 | 梁文锋 | 马斯克 | API定价
三句話摘要
三家頂流大模型同時發力,DeepSeek V4 Pro、Grok 4.6、Qwen3.8竞速,拉低前沿AI的价格天花板。 當高性能模型的成本從以美元計,降低到美分甚至零頭時,屬於所有人的 AI 應用大爆發可能才剛開始。 性能逼近且成本摧毀:V4 Pro 在 10 項智能體測試中平均僅落後 Fable 5 共 2.8%,部分超越,但價格不到 Fable 5 的 2%,直接打碎了「高性能必然高成本」的假設。
重點整理
重點- 1
性能逼近且成本摧毀:V4 Pro 在 10 項智能體測試中平均僅落後 Fable 5 共 2.8%,部分超越,但價格不到 Fable 5 的 2%,直接打碎了「高性能必然高成本」的假設。
- 2
架構創新帶來邊際成本革命:V4 Pro 採用壓縮稀疏注意力和重度壓縮注意力,將單 token 計算量降至 V3.2 的 27%,KV 快取降至 10%,使 100 萬 token 上下文的成本可控。
- 3
模型正在優先為代碼讓位:V4 Pro 的思維鏈呈現「山頂洞人語」風格(極度省略非關鍵詞彙),雖然減少 token 消耗但寫作能力受影響,反映出 Agent 狂飆時代下能力配置的新優先級。
- 4
長期自主工作成為新戰場:Qwen3.8 實現了連續自主編程 16 天、獨立論文復現、超 2000 輪虛擬經營,三家模型都在強化多步驟閉環工作的智能體能力。
實用技巧與重點
乾貨- DeepSeek V4 Pro
- 參數規模:160 萬億(混合專家),單 token 啟動 490 億參數
- 上下文:100 萬 token,輸出最長 38.4 萬 token
- 價格:輸入 0.435 美元/百萬 token,輸出 0.87 美元/百萬 token,快取命中 0.003625 美元/百萬 token
- 計算效率:單 token 計算量 27%(相對 V3.2),KV 快取 10%(相對 V3.2)
- 基準測試:在 CyberGym 獲 83.3 分(超過 Fable 5 的 83.1 分、Opus 4.8 的 78.3 分);AutomationBench 31.8 分;Terminal-Bench 2.1 達 87.9 分;DeepSWE 62.7 分(相對預覽版 12.8 分的 4.9 倍)
- API:支援普通、高推理、最高推理三種模式,並發限制 Flash 2500、Pro 5000
- 接口:支援 OpenAI 和 Anthropic 格式,工具呼叫、結構化 JSON 輸出
- Grok 4.6
- 價格:6 美元/百萬輸出 token
- 基準測試:綜合智能指數 61 分(Fable 5 為 62 分);CursorBench 69.9%(超 GPT-5.6 Sol 67.2%);FrontierCode 61.3%(超 GPT-5.6 Sol 60.6%);GDPval-AA v2 獲 1753 Elo(超 Fable 5 的 1741);AA-Briefcase 1577 Elo(超 Fable 5 的 1574);Harvey LAB 法務任務 15.8%(Fable 5 為 11.3%,GPT-5.6 為 2.5%)
- 實測對比(相同提示詞):Flappy Bird 遊戲中,V4 Pro 用 2 萬+ token(成本 0.019 美元),Grok 4.6 用約 5000 token(成本 0.03 美元),但 V4 Pro 視覺細節更豐富
- Qwen3.8
- 開源版本:2.4 萬億參數(Qwen3.8-2.4T-A95B),單 token 啟動 950 億參數
- 上下文:原生 262144 token,可擴充至 101 萬 token
- 價格:國內 12 元/百萬輸入 token、36 元/百萬輸出 token、1.5 元/百萬快取命中;海外 2 美元/百萬輸入、6 美元/百萬輸出、0.25 美元/百萬快取
- 推理引擎:SGLang、vLLM、TokenSpeed
- 基準測試:PaperBench 93.0 分(超 Fable 5、GPT-5.6 Sol、Opus 4.8);OSWorld-Verified 86.1 分;參數化 CAD 91.5 分;TerminalBench 2.1 為 86.6 分(低於 GPT-5.6 Sol 88.8 分);SWE-bench Pro 67.7 分(低於 Fable 5 80.0 分);VideoMME v2 68.3 分(低於 GPT-5.6 Sol 71.1 分)
- 自主工作實測:連續自主編程 16 天、獨立復現並改進論文、超 2000 輪互動經營虛擬電商
結論
結論“當高性能模型的成本從以美元計,降低到美分甚至零頭時,屬於所有人的 AI 應用大爆發可能才剛開始。”
完整解析
詳細昨晚三家頂流大模型集體發力,開啟了新一輪「神仙打架」。DeepSeek 正式上線了 V4 Pro,這是一個 160 萬億參數的混合專家架構,擁有百萬 token 的上下文視窗和 38.4 萬 token 的輸出上限。最令人矚目的是其價格策略:每百萬輸入 token 僅需 0.435 美元,輸出 0.87 美元,這個定價體系得以實現的核心在於其架構創新。V4 Pro 採用了壓縮稀疏注意力和重度壓縮注意力兩種機制,將單 token 的計算量壓低至 V3.2 時代的 27%,KV 快取也從原來的大幅削減到 10%。對於處理百萬級 token 的長文本任務而言,這種邊際成本的降低是顛覆性的。
在性能上,V4 Pro 與 Claude Fable 5 進行了正面對標。在 10 項智能體評測中,V4 Pro 平均僅落後 2.8%,部分任務甚至實現超越——在網路安全測試 CyberGym 上以 83.3 分領先 Fable 5 的 83.1 分,在自動化任務測試 AutomationBench 上以 31.8 分遠超對手的 29.1 分。尤其值得注意的是軟體工程智能體 DeepSWE 的表現,從預覽版的 12.8 分飆升至 62.7 分,相當於原來的 4.9 倍,接近 Fable 5 的 70 分水位。API 層面上,V4 Pro 提供三種推理模式(普通、高推理、最高推理),並支援 OpenAI 和 Anthropic 雙格式接口,開發者無需改寫代碼即可遷移。
與此同時,馬斯克發布了 Grok 4.6,這款模型在編碼和知識型任務上展現出強勢競爭力。在 CursorBench 上以 69.9% 超越 GPT-5.6 Sol 的 67.2%,在 FrontierCode 上達成 61.3% 也壓過對手的 60.6%。更戲劇性的是,Grok 4.6 在接近真實職場交付的知識工作評測中實現翻身反殺——GDPval-AA v2 達成 1753 Elo(領先 Fable 5 的 1741),AA-Briefcase 獲得 1577 Elo(超過 Fable 5 的 1574),而在專業法務任務 Harvey LAB 上更是以 15.8% 遠超 Fable 5 的 11.3% 和 GPT-5.6 的 2.5%。有開發者用完全相同的提示詞讓兩款模型從零手搓 Flappy Bird 遊戲,V4 Pro 雖然消耗超過 2 萬 token(成本 0.019 美元),但最終成品在場景層次、角色穿管道動畫等細節上明顯更勝一籌;Grok 4.6 雖然更省 token(僅 5000),但成本反而達到 0.03 美元,顯示出定價模式的差異。
與此同時,阿里千問團隊宣布開放 Qwen3.8-Max 等級的 240 萬億參數權重版本,這是千問首次對外開放旗艦級模型。該版本支援 262144 token 原生上下文,可擴充至 101 萬 token,預設啟用思考模式。在基準測試中,Qwen3.8-Max 在論文復現測試 PaperBench 上達成 93.0 分(超越 Fable 5、GPT-5.6 Sol 和 Opus 4.8),在電腦操作能力評估 OSWorld-Verified 上以 86.1 分位居首位,參數化 CAD 測試達 91.5 分。最值得關注的是其長期自主工作能力——千問團隊讓 Qwen3.8-Max 連續自主編程 16 天,獨立復現並改進研究論文,甚至在虛擬電商企業經營中完成超 2000 輪互動,全程無需人工干預。
三款模型的同時爆發背後有著深層邏輯。首先,它們不約而同地強化了 Agent 自主工作的能力,將焦點從單次對話推理轉向多步驟閉環任務;其次,成本構造發生了根本轉變,V4 Pro 不到 2% 的定價優勢直接摧毀了「前沿性能必然昂貴」的認知。業界觀察人士指出,這兩個幾乎不可能同時出現的詞彙——強大且實惠——第一次真正走到了一起,在網路安全、知識型任務、代碼生成乃至長期自主工作的多個戰場上實現了前沿能力的民主化。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


