KeyFrame內部研究專用

Claude Mythos 5 LEAKED & IS Coming Sooner Than Expected & GPT-5.6 Checkpoint Out! Huge AI News!

World of AI·6月7日週日·16 min英文

三句話摘要

一周 AI 重磅更新:Claude Mythos 5 洩露定價與驚人能力、GPT 5.6 新檢查點、DeepSeek GUI 將至、Google 新視訊模型浮出水面。 Claude Mythos 5、GPT 5.6、DeepSeek GUI 與 Google Purple 的同步推進表明 AI 軍備競賽進入新階段,定價與性能的新平衡點將重塑市場格局。 Claude Mythos 5 並非 Opus 的版本升級,而是 Anthropic 推出的全新模型類別,能力跨越程式設計、互動應用、視覺設計等多個領域,其高昂定價反映出模型性能的量級躍升。GPT 5.6 已開始進行紅隊測試並替換舊檢查點,OpenAI 仍有時間在正式發佈前完善不同檢查點的性能差異。DeepSeek 推出原生應用客戶端將解鎖適應不同工作流的高級功能,特別對程式研究與長上下文工作有益。Google 的 Purple 視訊模型在文字對齐與視覺逼真度上實現新突破,強烈暗示這可能是 Omni Pro 級別的重大升級。

重點整理

重點
  • 1

    Claude Mythos 5 並非 Opus 的版本升級,而是 Anthropic 推出的全新模型類別,能力跨越程式設計、互動應用、視覺設計等多個領域,其高昂定價反映出模型性能的量級躍升。GPT 5.6 已開始進行紅隊測試並替換舊檢查點,OpenAI 仍有時間在正式發佈前完善不同檢查點的性能差異。DeepSeek 推出原生應用客戶端將解鎖適應不同工作流的高級功能,特別對程式研究與長上下文工作有益。Google 的 Purple 視訊模型在文字對齐與視覺逼真度上實現新突破,強烈暗示這可能是 Omni Pro 級別的重大升級。

實用技巧與重點

乾貨
  • Claude Mythos 5:
  • 定價:輸入代幣 $25/百萬,輸出代幣 $125/百萬(約為 Opus 4.8 的 5 倍)
  • 預計推出時間:6 月 15 日前後(根據 Polygon 市場評估有 47% 可能性)
  • 完整應用案例:Minecraft 克隆版(含挖礦、製作系統、多人遊戲)、Cut the Rope 功能版、鋼琴音樂可視化、Cursor Composer 網站完整複製、廚房 3D 場景、PS5/PS4/PSP/Nintendo Switch SVG 控制器(精確度驚人)
  • 紅隊測試發現:Mythos 在 Zcash 區塊鏈中發現並驗證了 4 年未被發現的漏洞(允許無限挖礦代幣),洩露後幣價暴跌 48%
  • 代幣消耗:即使簡單提示也可能消耗約 20 萬個代幣
  • GPT 5.6:
  • 新檢查點:Kelpar Alpha、Kindle Alpha(Kindle Alpha 為發布候選版本)
  • 舊檢查點 Dual Alpha 已被移除
  • 展示能力:中等推理能力下直接生成完整前端代碼與 Xbox SVG 控制器
  • 預期發佈時間:本月晚些時候
  • DeepSeek GUI:
  • 形式:原生桌面應用(非網頁介面)
  • 新功能方向:支援代理控制、提升長上下文工作效率、適配不同工作流需求
  • Purple 視訊模型:
  • 發現平台:Artificial Arena
  • 核心改進:文字一致性、文字推理視覺生成精度、動物視訊逼真度(含細節與動作)
  • 推測身份:Google Omni 或 Omni Pro
  • 其他:
  • Vibe Coding 平台發佈(免費線上基準測試工具)
  • UWorld U1 伴侶機器人:3 天內 1000+ 預訂

結論

結論

Claude Mythos 5、GPT 5.6、DeepSeek GUI 與 Google Purple 的同步推進表明 AI 軍備競賽進入新階段,定價與性能的新平衡點將重塑市場格局。

完整解析

詳細

本週 AI 領域動靜頻繁,幾款重磅模型的更新與洩露預示著下半年競爭的進一步升溫。首先是 Anthropic 的 Claude Mythos 5。根據洩露信息,Mythos 並非 Opus 系列的常規版本升級,而是一個獨立的新模型類別,將與 Haiku、Sonnet 和 Opus 並行發佈。從 API 目錄中出現後迅速消失的痕跡來看,正式推出已近在咫尺,Polygon 市場評估甚至給出了 6 月 15 日前後的具體時間線。

定價洩露才是真正引起關注的焦點。若傳聞屬實,Mythos 5 的輸入與輸出代幣價格將分別為 Opus 4.8 的約 5 倍,這乍看可能令人卻步,但已公開的能力演示解釋了為何 Anthropic 敢於開價。該模型不僅能生成完整的 Minecraft 遊戲克隆版,其中包含挖礦、多層製作系統、多人遊戲網路功能和完整的遊戲循環,甚至首次真正正確實現了製作邏輯——這在過往模型中極易出錯。更驚人的是,Mythos 還能直接在瀏覽器中生成 Cut the Rope 的完全可玩版本,涵蓋繩索物理、物體互動和核心遊戲機制。在視覺設計上,它能以 SVG 格式無誤地複製 PS5、PS4、PSP 和 Nintendo Switch 的控制器與外觀,細節精度令人難以置信。這些不是靜態圖形,而是交互式應用、音樂可視化面板、廚房 3D 場景等全棧體驗。

值得注意的是,Mythos 已進入紅隊測試階段,而測試中最戲劇化的發現發生在區塊鏈領域。該模型被用來審計 Zcash 加密貨幣,並在短時間內發現並驗證了一個 4 年來未被發現的嚴重漏洞——允許玩家無限挖礦代幣。這一發現於 6 月 1 日被修復,但洩露後 Zcash 幣價暴跌 48%。這個案例充分展示了強大 AI 編碼模型的雙面性:它們可以創造精妙的互動體驗,也可以發現隱藏已久的安全缺陷,這也是 Anthropic 在正式發佈前進行大規模安全評估的原因。

OpenAI 方面,GPT 5.6 迎來了新的檢查點更新。舊的 Dual Alpha 檢查點被替換為 Kelpar Alpha 和 Kindle Alpha,其中 Kindle Alpha 被定為發佈候選。新模型在中等推理設置下展現了令人矚目的前端生成能力——能在簡短提示下直接從 API 輸出完整的前端代碼和精細 SVG 圖形(如 Xbox 控制器),且無需額外工具鏈或複雜配置。不過,初步對比顯示 Kindle Alpha 相比 Kelpar Alpha 在某些維度有明顯退步,OpenAI 仍有時間在月底發佈前進行調優。

DeepSeek 方面則在準備推出原生 GUI 應用,這對該平台的使用體驗將是一次重大升級。目前的網頁介面已相當成熟,但專門的桌面客戶端將解鎖高級功能,包括代理控制、更優化的長上下文工作流,以及對程式研究和日常 AI 生產力工作的深度適配。

最後,Google 的視訊生成領域似乎也有新動作。在 Artificial Arena 平台上發現了代號為 Purple 的新隱形視訊模型,它在文字一致性、文字推理視覺生成和動物視訊逼真度上都超越了當前市場水平。細節精度和動作流暢度的表現暗示這可能是 Omni 或 Omni Pro 級別的重大升級版本,Google 很可能在悄悄進行視訊生成能力的系統性提升。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。