KeyFrame內部研究專用

Claude Fable 5 IS INCREDIBLE! Greatest AI Model Ever! (Fully Tested)

World of AI·6月10日週三·16 min英文

三句話摘要

Anthropic 發布 Claude Fable 5 旗艦模型,展示其在代碼生成、3D 渲染與交互應用開發的突破性能力。 Claude Fable 5 代表 Anthropic 的重大回歸,其在代碼生成、3D 渲染與交互應用開發的突破性能力重新定義了大型語言模型的實用邊界。 性能全面領先:Fable 5 在幾乎所有基準測試達成最先進水平,尤其軟體工程領域相比 GPT-4.5 提升 20%,在 Agentic 編碼完全創造新記錄,完全重新定義模型能力邊界。

重點整理

重點
  • 1

    性能全面領先:Fable 5 在幾乎所有基準測試達成最先進水平,尤其軟體工程領域相比 GPT-4.5 提升 20%,在 Agentic 編碼完全創造新記錄,完全重新定義模型能力邊界。

  • 2

    完整應用生成能力:模型能從單一提示生成包含完整功能的複雜應用,Minecraft 克隆涵蓋多個生物群系、洞穴系統、水動力學、昼夜循環、敵對生物、物品欄與製作系統,展現從架構到細節的全棧開發能力。

  • 3

    視覺與互動卓越:在 Three.js 3D 渲染、SVG 生成、前端設計上表現突出,能精確實現響應式布局、物理引擎模擬、實時光線追踪、動畫效果,甚至通過純視覺輸入 55 分鐘自動通關 Pokemon 遊戲。

  • 4

    性價比優勢:雖然價格較高,但相比 Opus 4.8 和 GPT-4.5,編程各領域性價比差異巨大,對需要高質量代碼生成的開發者與企業極具價值。

實用技巧與重點

乾貨
  • 定價與配額
  • 輸入:$10/百萬 token
  • 輸出:$50/百萬 token
  • 免費試用期:至 2026 年 6 月 22 日
  • 上下文窗口:100 萬 token
  • 性能基準
  • SWE Bench Pro:比 GPT-4.5 提升約 20%
  • OS World:85% GDP 得分
  • Cognition Frontier 代碼評估:中等努力下即獲最高分
  • 應用演示清單
  • 遊戲類:Minecraft 克隆(生物群系、洞穴、水動力學、昼夜循環)、Pokemon Fire Red 自動通關(55 分鐘)、FPS 遊戲(敵人、武器系統、生命值條)、Terraria 2D 遊戲克隆
  • 作業系統克隆:macOS(顶部菜單、Finder、Safari、音樂/照片/筆記應用)、Windows(登入頁面、通知系統、Edge、Copilot、回收站)
  • 3D 視覺化:太陽系模擬(行星、軌道、小行星帶)、等距房間(壁爐、互動貓、晝夜循環)、物理引擎示範、實時光線追踪(柔化陰影、環境光遮蔽、倒影、大氣雾)
  • 前端演示:響應式布局、熔岩燈 SVG 動畫、蝴蝶 SVG、滾動觸發效果、圖片轉前端程式碼
  • 核心優勢領域:軟體工程、知識工作、浏覽器使用、視覺識別、科學研究
  • 訪問方式:API、官方聊天機器人、作者基準測試工具(免費)
  • 安全措施:高風險領域(網路安全)增加防護;Mythos 未限制版本與 Fable 5 共享底層模型

結論

結論

Claude Fable 5 代表 Anthropic 的重大回歸,其在代碼生成、3D 渲染與交互應用開發的突破性能力重新定義了大型語言模型的實用邊界。

完整解析

詳細

Anthropic 終於推出了其最強大的通用發布模型 Claude Fable 5,這代表公司在 AI 能力上的一次重大飛躍。與之前版本相比,Fable 5 在軟體工程、知識工作、瀏覽器操作、視覺識別和科學研究等多個關鍵領域都實現了本質性的性能提升。講者強調這不僅是小幅更新或營銷炒作,而是 Anthropic 將其頂尖的 Mythos 級別智能能力融入到普通用戶可以實際訪問的產品版本中。為應對如此強大模型帶來的風險,Anthropic 特別在網路安全等高風險領域增加了安全防護措施。有趣的是,未受限制的 Mythos 版本與 Fable 5 共享相同基礎模型,只是後者啟用了安全機制。

在性能基準測試中,Fable 5 的表現令人印象深刻。在 SWE Bench Pro 上比 GPT-4.5 提升約 20%,對長期認為 GPT-4.5 是最佳模型的人來說是巨大轉變。在 OS World 獲得 85% GDP 得分,在 Agentic 編碼方面創造新記錄。即使在通用世界 AI 基準測試中,Fable 5 每個領域都表現出色。模型配備 100 萬 token 巨大上下文窗口,專為長期推理、智能工作流程、複雜多日任務構建。定價方面,輸入 token 約 $10/百萬,輸出 $50/百萬,雖然看似不便宜,但根據講者經驗,考量模型在所有基準測試達成最先進水平,此定價合理。

在實際應用演示中,Fable 5 展現了令人驚嘆的多個案例。首先是完整的 Minecraft 克隆遊戲,包含多個生物群系、無限地形生成、昼夜循環、礦石系統、洞穴系統和完整水動力學。遊戲有工作的物品欄系統,玩家可製作物品、破壞方塊、水下潛水,甚至遇到敵對生物。整個遊戲透過單一提示用 Claude 代碼的 Max 思維模式生成。講者還展示了功能齊全的 macOS 克隆系統,包括頂部菜單欄、深色/淺色模式切換、Finder 文件管理器、Safari 瀏覽器、音樂應用(含完整播放系統)、照片應用、筆記應用、日曆應用、繪圖應用和終端。甚至為之前生成的 Minecraft 克隆添加了背景音樂。

Windows 系統克隆演示展示了高保真度的實現,包括準確的登入頁面、通知系統、亮度調節、多窗口支援、右鍵菜單、個性化設置、浅色/深色模式切換、自訂壁紙、Microsoft Edge 瀏覽器、終端、Copilot 集成、回收站、文件瀏覽器和預裝遊戲。在前端開發能力上,Fable 5 相比包括 Gemini 的所有模型都有巨大進步,在響應式布局、精美界面生成、滾動觸發效果方面表現突出。唯一遺憾是講者希望模型停止使用那種每代 Claude 前端都採用的特定 UI 風格。

在 Three.js 3D 開發中,模型創建了完整的 FPS 遊戲,包含不同敵人、可射擊目標、動畫、生命值條、通知系統和可切換武器。在物理演示中,Fable 5 創建了模擬讓不同方塊落下並準確展示物理定律作用。對於實時 WebGL 光線追踪渲染,支持柔化陰影、環境光遮蔽、倒影和大氣雾調整。太陽系模擬準確展示所有行星軌道、小行星帶和土星運行軌跡。在 SVG 生成中,模型創建了熔岩燈動畫和蝴蝶矢量圖,效果逼真。最後的 3D 世界構建演示是完全使用 Three.js 開發、直接在瀏覽器運行,包含美麗的著色路徑、攝影機運動和互動物體系統。

特別值得注意的是 Pokemon Fire Red 自動通關演示。模型在 55 分鐘內完全通關遊戲,沒有地圖、記憶重置或導航裝置,只透過看屏幕自行摸索。它聰明地探索世界、與訓練家對戰、瀏覽菜單、解決所有路線,展現了視覺理解和自主決策的卓越能力。講者對 Anthropic 表示歉意,因之前吐槽該公司,但認為 Fable 5 是令人印象深刻的回應。他相信此模型絕對值得關注,特別是在 AI 基準測試領域。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。