KeyFrame內部研究專用

太疯狂了!Claude Mythos 5 正式发布,限免使用 Anthropic 最强 AI !实测 Fable 5 真有这么神? | 零度解说

零度解说·6月10日週三·10 min中文

三句話摘要

Anthropic 發布 Claude Fable 5 與 Mythos 5,展示視覺還原、遊戲通關、程式碼生成與 Bug 修復等實測能力。 Claude Fable 5 已在視覺還原、程式碼生成與自主推理上全面超越競品,免費體驗期至 6 月 22 日,現在是最低成本驗證 AI 實際落地能力的時機。 Fable 與 Mythos 分工明確:兩者共享同一底層模型,差異在於限制程度而非智力,Mythos 5 擁有更大自主權,主要用於防禦性網路安全與生物醫學研究,這是 Anthropic 刻意設計的雙軌策略。

重點整理

重點
  • 1

    Fable 與 Mythos 分工明確:兩者共享同一底層模型,差異在於限制程度而非智力,Mythos 5 擁有更大自主權,主要用於防禦性網路安全與生物醫學研究,這是 Anthropic 刻意設計的雙軌策略。

  • 2

    視覺理解超越識別層次:模型不只辨識圖片內容,更能理解圖片背後的邏輯關係,例如從科學圖表精確提取數據、憑截圖還原可運行的前端程式碼,對比競品效果差距明顯。

  • 3

    遊戲能力驗證長期自主推理:在殺戮尖塔中結合長期記憶後性能提升超過三倍,在異星工廠中自主完成資源規劃、生產佈局與故障排除,說明 AI 的真正價值正從對話轉向持續自主執行複雜任務。

  • 4

    低成本生成可用產品:一句提示詞生成帶 BOSS、計分系統、支援手機與電腦的完整遊戲,後續迭代加入音效,整個流程無需人工修改,展示了從需求到可交付產品的端到端能力。

實用技巧與重點

乾貨
  • 模型名稱:Claude Fable 5(大眾版/鬼斧神工)、Claude Mythos 5(高權限版)
  • 免費期限:2026 年 6 月 22 日前免費不限速
  • 入口:Claude 官網免費註冊登入後,模型選單出現 Fable 5 選項
  • 視覺測試:28 根筷子計數 → Claude 答對,ChatGPT(最新版)答錯(回答 30 根)
  • 截圖還原對比:以京東官網首頁截圖測試,Claude Haiku 模型生成效果優於 Google Gemini Pro
  • 遊戲性能數據:殺戮尖塔中加入長期記憶後,性能比上一代提升超過 3 倍
  • 遊戲能力案例:精靈寶可夢火紅完整通關(無地圖、無插件、無隱藏數據)
  • 平台工具:MCP、GPT-4(外部對比案例,完成類似殺戮尖塔任務耗時 3-4 小時)
  • 應用領域:防禦性網路安全、生物醫學研究、高科技製藥
  • 物理模擬:從第一原理構建太陽系模擬器,並準確預測日食
  • CAD 能力:使用瀏覽器端 CAD 編輯器設計 3D 列印模型,編輯器本身亦由 Claude 開發
  • Bug 修復:上傳無法運行的 Python 影片分類管理腳本,一次修復後正常執行掃描、分類、匯出報告、播放影片

結論

結論

Claude Fable 5 已在視覺還原、程式碼生成與自主推理上全面超越競品,免費體驗期至 6 月 22 日,現在是最低成本驗證 AI 實際落地能力的時機。

完整解析

詳細

Anthropic 於近日突然公開了兩個先前因安全疑慮而未發布的模型:Claude Fable 5 與 Claude Mythos 5。兩者共用同一底層架構,核心差異在於限制程度:Fable 5 面向大眾、限制較多;Mythos 5 擁有更高自主權限,主要應用於防禦性網路安全與生物醫學研究。最值得關注的是,兩個模型目前均可免費且不限速使用,期限至 2026 年 6 月 22 日,任何人只需在官網免費註冊即可體驗。

視覺理解能力是本次發布的核心亮點。影片主持人以一束 28 根筷子做測試,Claude 透過分析菱形排列成功答對(ChatGPT 同題答錯,回答 30 根)。在截圖還原測試中,主持人以京東官網首頁截圖為輸入,Claude Haiku(非最強版本)生成的 HTML+CSS 頁面在佈局、功能區與商品展示上幾乎達到一比一還原,且效果明顯優於 Google Gemini Pro 的輸出結果。Anthropic 的官方數據也顯示,模型能從複雜科學圖表中精確提取數字,並僅憑遊戲截圖完整通關精靈寶可夢火紅,全程無地圖、無外掛、無隱藏數據輔助,所有決策完全依賴自身推理。

在程式碼生成與遊戲開發方面,主持人以一句極簡提示詞(「生成一個空戰遊戲,含計分系統與 BOSS,手機電腦都能玩」)讓模型輸出完整可執行的飛行射擊遊戲「霓虹空戰」,遊戲邏輯、BOSS 血條、計分機制一應俱全,後續加入音效也只需一次迭代。在 Bug 修復場景中,一個因錯誤而無法啟動的 Python 影片分類管理腳本,上傳後一次修復成功,修復後掃描、分類、匯出報告、呼叫播放器等功能全數正常。這些案例共同說明模型已能處理完整的端到端開發流程,而非僅輔助片段任務。

從更宏觀的視角看,Claude 在殺戮尖塔中結合長期記憶後性能提升超過三倍,在異星工廠中自主完成資源規劃到自動化擴張的全流程,幾乎不需人工介入。這正是當前 AI Agent 快速崛起的核心驅動力:AI 的價值正從「對話問答」全面轉向「持續自主完成複雜長期任務」。Mythos 5 在生物醫學與高科技製藥領域的潛在應用,也預示著高自主 AI 在專業科研場景中的深度介入。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。