KeyFrame內部研究專用

DeepSeek V4 Pro发布,价格不到Fable的2% | 撞车Grok 4.6 | Qwen3.8开放权重 | MOE | 长上下文 | 开源大模型 | 梁文锋 | 马斯克 | API定价

Best Partners TV·8月13日週四·11 min中文

三句話摘要

三家頂流大模型同時發力,DeepSeek V4 Pro、Grok 4.6、Qwen3.8竞速,拉低前沿AI的价格天花板。 當高性能模型的成本從以美元計,降低到美分甚至零頭時,屬於所有人的 AI 應用大爆發可能才剛開始。 性能逼近且成本摧毀:V4 Pro 在 10 項智能體測試中平均僅落後 Fable 5 共 2.8%,部分超越,但價格不到 Fable 5 的 2%,直接打碎了「高性能必然高成本」的假設。

重點整理

重點
  • 1

    性能逼近且成本摧毀:V4 Pro 在 10 項智能體測試中平均僅落後 Fable 5 共 2.8%,部分超越,但價格不到 Fable 5 的 2%,直接打碎了「高性能必然高成本」的假設。

  • 2

    架構創新帶來邊際成本革命:V4 Pro 採用壓縮稀疏注意力和重度壓縮注意力,將單 token 計算量降至 V3.2 的 27%,KV 快取降至 10%,使 100 萬 token 上下文的成本可控。

  • 3

    模型正在優先為代碼讓位:V4 Pro 的思維鏈呈現「山頂洞人語」風格(極度省略非關鍵詞彙),雖然減少 token 消耗但寫作能力受影響,反映出 Agent 狂飆時代下能力配置的新優先級。

  • 4

    長期自主工作成為新戰場:Qwen3.8 實現了連續自主編程 16 天、獨立論文復現、超 2000 輪虛擬經營,三家模型都在強化多步驟閉環工作的智能體能力。

實用技巧與重點

乾貨
  • DeepSeek V4 Pro
  • 參數規模:160 萬億(混合專家),單 token 啟動 490 億參數
  • 上下文:100 萬 token,輸出最長 38.4 萬 token
  • 價格:輸入 0.435 美元/百萬 token,輸出 0.87 美元/百萬 token,快取命中 0.003625 美元/百萬 token
  • 計算效率:單 token 計算量 27%(相對 V3.2),KV 快取 10%(相對 V3.2)
  • 基準測試:在 CyberGym 獲 83.3 分(超過 Fable 5 的 83.1 分、Opus 4.8 的 78.3 分);AutomationBench 31.8 分;Terminal-Bench 2.1 達 87.9 分;DeepSWE 62.7 分(相對預覽版 12.8 分的 4.9 倍)
  • API:支援普通、高推理、最高推理三種模式,並發限制 Flash 2500、Pro 5000
  • 接口:支援 OpenAI 和 Anthropic 格式,工具呼叫、結構化 JSON 輸出
  • Grok 4.6
  • 價格:6 美元/百萬輸出 token
  • 基準測試:綜合智能指數 61 分(Fable 5 為 62 分);CursorBench 69.9%(超 GPT-5.6 Sol 67.2%);FrontierCode 61.3%(超 GPT-5.6 Sol 60.6%);GDPval-AA v2 獲 1753 Elo(超 Fable 5 的 1741);AA-Briefcase 1577 Elo(超 Fable 5 的 1574);Harvey LAB 法務任務 15.8%(Fable 5 為 11.3%,GPT-5.6 為 2.5%)
  • 實測對比(相同提示詞):Flappy Bird 遊戲中,V4 Pro 用 2 萬+ token(成本 0.019 美元),Grok 4.6 用約 5000 token(成本 0.03 美元),但 V4 Pro 視覺細節更豐富
  • Qwen3.8
  • 開源版本:2.4 萬億參數(Qwen3.8-2.4T-A95B),單 token 啟動 950 億參數
  • 上下文:原生 262144 token,可擴充至 101 萬 token
  • 價格:國內 12 元/百萬輸入 token、36 元/百萬輸出 token、1.5 元/百萬快取命中;海外 2 美元/百萬輸入、6 美元/百萬輸出、0.25 美元/百萬快取
  • 推理引擎:SGLang、vLLM、TokenSpeed
  • 基準測試:PaperBench 93.0 分(超 Fable 5、GPT-5.6 Sol、Opus 4.8);OSWorld-Verified 86.1 分;參數化 CAD 91.5 分;TerminalBench 2.1 為 86.6 分(低於 GPT-5.6 Sol 88.8 分);SWE-bench Pro 67.7 分(低於 Fable 5 80.0 分);VideoMME v2 68.3 分(低於 GPT-5.6 Sol 71.1 分)
  • 自主工作實測:連續自主編程 16 天、獨立復現並改進論文、超 2000 輪互動經營虛擬電商

結論

結論

當高性能模型的成本從以美元計,降低到美分甚至零頭時,屬於所有人的 AI 應用大爆發可能才剛開始。

完整解析

詳細

昨晚三家頂流大模型集體發力,開啟了新一輪「神仙打架」。DeepSeek 正式上線了 V4 Pro,這是一個 160 萬億參數的混合專家架構,擁有百萬 token 的上下文視窗和 38.4 萬 token 的輸出上限。最令人矚目的是其價格策略:每百萬輸入 token 僅需 0.435 美元,輸出 0.87 美元,這個定價體系得以實現的核心在於其架構創新。V4 Pro 採用了壓縮稀疏注意力和重度壓縮注意力兩種機制,將單 token 的計算量壓低至 V3.2 時代的 27%,KV 快取也從原來的大幅削減到 10%。對於處理百萬級 token 的長文本任務而言,這種邊際成本的降低是顛覆性的。

在性能上,V4 Pro 與 Claude Fable 5 進行了正面對標。在 10 項智能體評測中,V4 Pro 平均僅落後 2.8%,部分任務甚至實現超越——在網路安全測試 CyberGym 上以 83.3 分領先 Fable 5 的 83.1 分,在自動化任務測試 AutomationBench 上以 31.8 分遠超對手的 29.1 分。尤其值得注意的是軟體工程智能體 DeepSWE 的表現,從預覽版的 12.8 分飆升至 62.7 分,相當於原來的 4.9 倍,接近 Fable 5 的 70 分水位。API 層面上,V4 Pro 提供三種推理模式(普通、高推理、最高推理),並支援 OpenAI 和 Anthropic 雙格式接口,開發者無需改寫代碼即可遷移。

與此同時,馬斯克發布了 Grok 4.6,這款模型在編碼和知識型任務上展現出強勢競爭力。在 CursorBench 上以 69.9% 超越 GPT-5.6 Sol 的 67.2%,在 FrontierCode 上達成 61.3% 也壓過對手的 60.6%。更戲劇性的是,Grok 4.6 在接近真實職場交付的知識工作評測中實現翻身反殺——GDPval-AA v2 達成 1753 Elo(領先 Fable 5 的 1741),AA-Briefcase 獲得 1577 Elo(超過 Fable 5 的 1574),而在專業法務任務 Harvey LAB 上更是以 15.8% 遠超 Fable 5 的 11.3% 和 GPT-5.6 的 2.5%。有開發者用完全相同的提示詞讓兩款模型從零手搓 Flappy Bird 遊戲,V4 Pro 雖然消耗超過 2 萬 token(成本 0.019 美元),但最終成品在場景層次、角色穿管道動畫等細節上明顯更勝一籌;Grok 4.6 雖然更省 token(僅 5000),但成本反而達到 0.03 美元,顯示出定價模式的差異。

與此同時,阿里千問團隊宣布開放 Qwen3.8-Max 等級的 240 萬億參數權重版本,這是千問首次對外開放旗艦級模型。該版本支援 262144 token 原生上下文,可擴充至 101 萬 token,預設啟用思考模式。在基準測試中,Qwen3.8-Max 在論文復現測試 PaperBench 上達成 93.0 分(超越 Fable 5、GPT-5.6 Sol 和 Opus 4.8),在電腦操作能力評估 OSWorld-Verified 上以 86.1 分位居首位,參數化 CAD 測試達 91.5 分。最值得關注的是其長期自主工作能力——千問團隊讓 Qwen3.8-Max 連續自主編程 16 天,獨立復現並改進研究論文,甚至在虛擬電商企業經營中完成超 2000 輪互動,全程無需人工干預。

三款模型的同時爆發背後有著深層邏輯。首先,它們不約而同地強化了 Agent 自主工作的能力,將焦點從單次對話推理轉向多步驟閉環任務;其次,成本構造發生了根本轉變,V4 Pro 不到 2% 的定價優勢直接摧毀了「前沿性能必然昂貴」的認知。業界觀察人士指出,這兩個幾乎不可能同時出現的詞彙——強大且實惠——第一次真正走到了一起,在網路安全、知識型任務、代碼生成乃至長期自主工作的多個戰場上實現了前沿能力的民主化。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。