KeyFrame內部研究專用

DeepSeek V4 Flash Is OUT, OpenAI "mewthree" + GPT-5.6 Price/Speed Update, Qwen 3.8 Kinsley, & More!

WorldofAI·7月31日週五·16 min英文

三句話摘要

OpenAI 大幅降價推出 Seoul Fast、DeepSeek Flash 4 性能飆升、多家廠商密集發布新模型,AI 市場進入極速競爭階段。 OpenAI 以雙層降價 + 推理加速牽頭,DeepSeek 以成本效益突襲智能體市場,多家廠商密集發布多模態和具身 AI 方案,AI 產業正進入「價格戰 + 性能戰 + 應用戰」的三線並進階段。 OpenAI 的雙向夾擊策略:一邊激進降低 Luna 和 Terra 的價格來搶佔低成本智能市場,一邊推出 Seoul Fast 提供 2.5 倍更快推理速度但只貴 53%。這直接挑戰中國模型的成本優勢,標誌著價格戰進入新階段。

重點整理

重點
  • 1

    OpenAI 的雙向夾擊策略:一邊激進降低 Luna 和 Terra 的價格來搶佔低成本智能市場,一邊推出 Seoul Fast 提供 2.5 倍更快推理速度但只貴 53%。這直接挑戰中國模型的成本優勢,標誌著價格戰進入新階段。

  • 2

    DeepSeek Flash 4 的智能體革命:在多項基準測試上實現 7-7.5 倍的性能躍升,號稱超越 GLM 5.2,足以在多智能體系統中用 2 個實例替代 4 個 GLM 實例,成本效益徹底改寫。

  • 3

    Quen 3.8 的視覺生成突破:新檢查點 Kinsley 在 3D 場景和前端生成上展現細節度和真實感,已在 Arena 內與 Fable 5 打成平手,暗示官方發布後將帶來強勁競爭。

  • 4

    多模態與具身 AI 的爆發:Minimax H3 支援 2K 視頻 + 立體聲的多模態編輯、Google Robotics 2 實現多機器人協作與自然語言規劃,整個生態正從純文本向多模態和物理世界延伸。

實用技巧與重點

乾貨
  • OpenAI 價格與性能更新
  • GPT 5.6 Luna:輸入 $0.20/百萬 token(降 80%),輸出 $1.20/百萬 token
  • GPT 5.6 Terra:輸入 $2/百萬 token(降 20%),輸出 $12/百萬 token
  • GPT 5.6 Seoul Fast:推理速度提升 2.5 倍,成本僅提升 53%(相比標準 Seoul)
  • Luna 約為 Seoul 價格的 1/25,性能仍具競爭力
  • DeepSeek Flash 4 性能數據
  • DeepSway 基準:7.3 → 54.4(提升 7.5 倍)
  • Cyberjim:38.7 → 76.7
  • AutomationBench:10.8 → 25.1
  • 宣稱超越 GLM 5.2 全部 8 項共享基準
  • 新模型發布清單
  • Suno SeedDance 2.5:原生 30 秒視頻,支援 50+ 多模態參考、多語言
  • Minimax H3:2K 15 秒視頻、立體聲、編輯和運動轉移功能、成本為競爭對手 1/3 以下
  • Quen 3.8 檢查點(Kinsley):3D 渲染、前端生成
  • Google Gemini Robotics 2:全身智能、精密操作(摺紙、備菜)、多機器人協作
  • Geeking Machines Inkling Small:276B 參數(12B 活躍)、開源、支援文字、圖像、音頻
  • OpenAI 內部檢查點:Sync、Magnesium(Design Arena)、Mew3(GPT 6 洩露)、Gemini 3.5 Pro(短暫出現於 Arena)
  • 行業動向
  • 預期 GPT 6 將於 8 月發布
  • DeepSeek Flash 4 目前僅通過 API,聊天機器人版本即將上線
  • Minimax H3 計畫開源

結論

結論

OpenAI 以雙層降價 + 推理加速牽頭,DeepSeek 以成本效益突襲智能體市場,多家廠商密集發布多模態和具身 AI 方案,AI 產業正進入「價格戰 + 性能戰 + 應用戰」的三線並進階段。

完整解析

詳細

這支影片記錄了 AI 業界一天內發生的密集更新,完整呈現市場競爭白熱化的現狀。

首先是 OpenAI 的價格攻勢。在 GPT 6 蓄勢待發的節點,OpenAI 對既有模型進行了大幅調整:Luna 和 Terra 的價格大幅下探,其中 Luna 降幅高達 80%,使其成為同級別模型中最廉價的選擇,成本約為 Seoul 的 1/25。這個舉措瞄準的正是中國廠商的成本優勢。同時推出的 Seoul Fast 則是另一個維度的競爭——在不顯著提高成本的前提下實現 2.5 倍的推理加速,打破了「快速推理必然昂貴」的業界常規。這是一場雙向夾擊:用 Luna 搶佔經濟型客戶,用 Seoul Fast 滿足性能需求。

DeepSeek Flash 4 則是另一顆重磅炸彈。儘管是 Flash 版本而非 Pro 版本,其性能躍升卻是驚人的——在多項基準測試上實現 7 倍以上的提升,並直接超越被廣泛應用的 GLM 5.2。這意味著在多智能體系統中,原本需要 4 個 GLM 實例才能達到的效果,現在用 2 個 DeepSeek Flash 實例就能實現,且效果更好。這不僅是性能的勝利,更是成本結構的重塑。

技術細節上,多家廠商在同一時間推出的升級同樣值得注意。Quen 3.8 的新檢查點 Kinsley 在 3D 渲染和前端生成上展現的細節度接近 AAA 級遊戲品質,水反射、光影、工業細節的真實感已經能與 Fable 5 打成平手。Minimax H3 則是打開了多模態視頻生成的新想像空間——支援 2K 解析度、15 秒時長、立體聲、多參考融合,成本還是競爭對手的 1/3 以下。Google Robotics 2 將物理世界的泛化進一步推進,多機器人協作、工具調用、自然語言規劃等能力暗示我們正在接近真正的具身 AI。

最有趣的是 GPT 6 的洩露跡象。OpenAI 在推廣 Chrome 擴展的影片中意外洩露了內部檢查點名稱 Mew3,雖然影片隨後被刪除並重新上傳,但這次泄露結合 8 月發布窗口的傳言,讓業界猜測 GPT 6 已經近在咫尺。同時出現在 Design Arena 中的 Sync、Magnesium 檢查點生成的程式碼品質也令人印象深刻。這一切都指向一個信號:AI 前沿公司正在準備下一波重大發布。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。