KeyFrame內部研究專用

太疯狂了!Claude Mythos 5 正式发布,限免使用 Anthropic 最强 AI !实测 Fable 5 真有这么神? | 零度解说

零度解说·6月10日週三·10 min中文

三句話摘要

Anthropic 發布 Claude Fable 5 與 Mythos 5,展示視覺還原、遊戲通關、程式碼生成與 Bug 修復等實測能力。 Claude Fable 5 已在視覺還原、程式碼生成與自主推理上全面超越競品,免費體驗期至 6 月 22 日,現在是最低成本驗證 AI 實際落地能力的時機。 Fable 與 Mythos 分工明確:兩者共享同一底層模型,差異在於限制程度而非智力,Mythos 5 擁有更大自主權,主要用於防禦性網路安全與生物醫學研究,這是 Anthropic 刻意設計的雙軌策略。

重點整理

重點
  • 1

    Fable 與 Mythos 分工明確:兩者共享同一底層模型,差異在於限制程度而非智力,Mythos 5 擁有更大自主權,主要用於防禦性網路安全與生物醫學研究,這是 Anthropic 刻意設計的雙軌策略。

  • 2

    視覺理解超越識別層次:模型不只辨識圖片內容,更能理解圖片背後的邏輯關係,例如從科學圖表精確提取數據、憑截圖還原可運行的前端程式碼,對比競品效果差距明顯。

  • 3

    遊戲能力驗證長期自主推理:在殺戮尖塔中結合長期記憶後性能提升超過三倍,在異星工廠中自主完成資源規劃、生產佈局與故障排除,說明 AI 的真正價值正從對話轉向持續自主執行複雜任務。

  • 4

    低成本生成可用產品:一句提示詞生成帶 BOSS、計分系統、支援手機與電腦的完整遊戲,後續迭代加入音效,整個流程無需人工修改,展示了從需求到可交付產品的端到端能力。

實用技巧與重點

乾貨
  • 模型名稱:Claude Fable 5(大眾版/鬼斧神工)、Claude Mythos 5(高權限版)
  • 免費期限:2026 年 6 月 22 日前免費不限速
  • 入口:Claude 官網免費註冊登入後,模型選單出現 Fable 5 選項
  • 視覺測試:28 根筷子計數 → Claude 答對,ChatGPT(最新版)答錯(回答 30 根)
  • 截圖還原對比:以京東官網首頁截圖測試,Claude Haiku 模型生成效果優於 Google Gemini Pro
  • 遊戲性能數據:殺戮尖塔中加入長期記憶後,性能比上一代提升超過 3 倍
  • 遊戲能力案例:精靈寶可夢火紅完整通關(無地圖、無插件、無隱藏數據)
  • 平台工具:MCP、GPT-4(外部對比案例,完成類似殺戮尖塔任務耗時 3-4 小時)
  • 應用領域:防禦性網路安全、生物醫學研究、高科技製藥
  • 物理模擬:從第一原理構建太陽系模擬器,並準確預測日食
  • CAD 能力:使用瀏覽器端 CAD 編輯器設計 3D 列印模型,編輯器本身亦由 Claude 開發
  • Bug 修復:上傳無法運行的 Python 影片分類管理腳本,一次修復後正常執行掃描、分類、匯出報告、播放影片

結論

結論

Claude Fable 5 已在視覺還原、程式碼生成與自主推理上全面超越競品,免費體驗期至 6 月 22 日,現在是最低成本驗證 AI 實際落地能力的時機。

完整解析

詳細

Anthropic 於近日突然公開了兩個先前因安全疑慮而未發布的模型:Claude Fable 5 與 Claude Mythos 5。兩者共用同一底層架構,核心差異在於限制程度:Fable 5 面向大眾、限制較多;Mythos 5 擁有更高自主權限,主要應用於防禦性網路安全與生物醫學研究。最值得關注的是,兩個模型目前均可免費且不限速使用,期限至 2026 年 6 月 22 日,任何人只需在官網免費註冊即可體驗。

視覺理解能力是本次發布的核心亮點。影片主持人以一束 28 根筷子做測試,Claude 透過分析菱形排列成功答對(ChatGPT 同題答錯,回答 30 根)。在截圖還原測試中,主持人以京東官網首頁截圖為輸入,Claude Haiku(非最強版本)生成的 HTML+CSS 頁面在佈局、功能區與商品展示上幾乎達到一比一還原,且效果明顯優於 Google Gemini Pro 的輸出結果。Anthropic 的官方數據也顯示,模型能從複雜科學圖表中精確提取數字,並僅憑遊戲截圖完整通關精靈寶可夢火紅,全程無地圖、無外掛、無隱藏數據輔助,所有決策完全依賴自身推理。

在程式碼生成與遊戲開發方面,主持人以一句極簡提示詞(「生成一個空戰遊戲,含計分系統與 BOSS,手機電腦都能玩」)讓模型輸出完整可執行的飛行射擊遊戲「霓虹空戰」,遊戲邏輯、BOSS 血條、計分機制一應俱全,後續加入音效也只需一次迭代。在 Bug 修復場景中,一個因錯誤而無法啟動的 Python 影片分類管理腳本,上傳後一次修復成功,修復後掃描、分類、匯出報告、呼叫播放器等功能全數正常。這些案例共同說明模型已能處理完整的端到端開發流程,而非僅輔助片段任務。

從更宏觀的視角看,Claude 在殺戮尖塔中結合長期記憶後性能提升超過三倍,在異星工廠中自主完成資源規劃到自動化擴張的全流程,幾乎不需人工介入。這正是當前 AI Agent 快速崛起的核心驅動力:AI 的價值正從「對話問答」全面轉向「持續自主完成複雜長期任務」。Mythos 5 在生物醫學與高科技製藥領域的潛在應用,也預示著高自主 AI 在專業科研場景中的深度介入。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。