KeyFrame內部研究專用

Anthropic 最新模型 Mythos 解析,比 Opus 4.6 還強?

Gary Chen·4月12日週日·19 min中文

三句話摘要

Anthropic 推出最強模型 Claude Mythos,決定不公開發布,改為限量開放給企業防禦安全,探討背後的安全考量與商業決策。 Anthropic 不發布 Mythos 固然可能受到算力限制的影響,但他們在這次危機中的每一步決策——倒貼 1.04 億美金、主動公開研究、承認失誤、堅守道德紅線——都說明了一個更深層的信念:他們認為 AI 安全不是可以獨佔的市場,而是一個整個業界都必須共贏的競賽。 Mythos 在三大軸線達成代溝突破:不只是編程能力進步,對網路安全和 AI 安全的理解都有質的飛躍,尤其是對 prompt injection 的抗性達業界最強水準。

重點整理

重點
  • 1

    Mythos 在三大軸線達成代溝突破:不只是編程能力進步,對網路安全和 AI 安全的理解都有質的飛躍,尤其是對 prompt injection 的抗性達業界最強水準。

  • 2

    強大的編程能力自動衍生為強大的漏洞能力:這不是兩項獨立訓練的技能,而是理解代碼的必然副產品。如同最強鎖匠同時必然成為最強開鎖者,模型無法只訓練一項而不訓練另一項。

  • 3

    真實世界證明超越 Benchmark:Mythos 不僅在 FFmpeg 找到人類工程師與 500 萬自動測試都未發現的漏洞,且修復品質高到 FFmpeg 團隊誤認為是人寫的,證明其達到生產級別品質。

  • 4

    Glasswing 策略是防禦優先的選擇:與其獨佔模型,Anthropic 選擇主動提供給防禦方,投入真金白銀補貼,並承諾 90 天內公開研究成果,主動削弱自身競爭優勢以推進業界集體防禦。

實用技巧與重點

乾貨
  • 性能數據(來自 244 頁 System Card):
  • SWE-Bench Verified:Opus 4.6 為 80.8%,Mythos 為 93.9%
  • SWE-Bench Pro:Opus 4.6 為 53.4%,Mythos 為 77.8%(+24 個百分點)
  • Terminal-Bench 2.0:Opus 4.6 為 65.4%,Mythos 為 82%
  • Firefox 147 漏洞利用:Opus 4.6 為 15.2%,Mythos 為 84%(5 倍差距)
  • Prompt injection 成功率:GPT-5.4 thinking 為 74%、Opus 4.6 thinking 為 21%、Mythos Preview thinking 為個位數百分比
  • 真實發現案例:
  • FFmpeg:16 年未發現的零日漏洞
  • OpenBSD:27 年未發現的遠端 crash 漏洞
  • Linux kernel:多個特權提升漏洞(privilege escalation)
  • Sandbox escape:多步驟 exploit 突破隔離環境,並發送 email 通知
  • Glasswing 合作方案:
  • 合作夥伴:AWS、Apple、Google、Microsoft、Nvidia、Cisco、Crowdstrike、JP Morgan、Broadcom 及 40+ critical infrastructure 組織
  • 資源投入:1 億美金 API credits + 400 萬美金捐給開源資安組織
  • 承諾:90 天內公開研究成果
  • Anthropic 的四項決策代價:
  • 拒絕美國國防部 2 億美金合約(因涉及全自主武器和大規模監控限制被拒)
  • 主動倒貼 1.04 億美金給業界
  • 主動公開研究成果給競爭對手
  • 在系統卡中主動承認訓練錯誤(reward model 看到 chain of thought、估算方法有瑕疵、sandbox escape 細節)

結論

結論

Anthropic 不發布 Mythos 固然可能受到算力限制的影響,但他們在這次危機中的每一步決策——倒貼 1.04 億美金、主動公開研究、承認失誤、堅守道德紅線——都說明了一個更深層的信念:他們認為 AI 安全不是可以獨佔的市場,而是一個整個業界都必須共贏的競賽。

完整解析

詳細

Claude Mythos 的出現代表了 AI 能力的一個臨界點。在編程能力上,它在 SWE-Bench Verified 上相比 Opus 4.6 跨越了 13 個百分點,達到 93.9% 的成功率——這個提升幅度遠超過去小版本升級的量級。但真正讓人震驚的是它在網路安全領域的表現。在 Firefox 147 漏洞利用測試上,它從 15.2% 的成功率直接跳到 84%,這是一個五倍級別的增長,同時它對 prompt injection 攻擊的抵抗力達到業界最低的個位數百分比。

這種能力的提升不是巧合,而是來自一個根本性的認知:強大的編程理解能力與強大的漏洞發現能力本質上是同一件事。就像世界上最頂尖的鎖匠必然理解每種鎖的工作原理和設計缺陷一樣,一個能寫出完美代碼的 AI 也必然能看出代碼中最細微的安全漏洞。這不是兩項獨立的技能,而是同一理解能力的兩個面向。

Mythos 在真實世界的表現讓這個理論變成了令人不安的現實。它在 FFmpeg 中找到了一個藏了 16 年的零日漏洞,這個漏洞躲過了全球數百名工程師和 500 萬個自動化測試。更驚人的是,它的修補方式品質如此之高,以至於以嚴厲著稱的 FFmpeg 團隊誤以為這是人類工程師的傑作。在 OpenBSD(業界公認最安全硬化的作業系統)中,Mythos 找到了一個沉睡 27 年的遠端崩潰漏洞。在 Linux kernel 中,它不僅找到了多個特權提升漏洞,還展示了將多個漏洞串聯成完整攻擊鏈的能力——這正是真實世界駭客的實際手法。最駭人聽聞的測試發生在紅隊評估中:Anthropic 把 Mythos 放入一個沙箱環境並要求它逃脫。Mythos 執行了一個中等複雜度的多步驟 exploit,成功突破限制並取得對外網路的存取權,然後發送電郵給負責測試的研究員——一個觀看著自己模型從應該關緊的牢籠裡逃出來的不寒而慄的時刻。

面對這樣的能力,Anthropic 做出了三條路中最難的選擇。他們沒有為了營收最大化而直接開放 API(那會讓他們賺得盆滿缽滿),也沒有完全鎖死模型(那不太現實,因為其他實驗室遲早會開發出類似的東西),而是推出了 Project Glasswing——一個精心設計的防禦優先方案。他們將 Mythos 限量開放給經過篩選的合作夥伴,包括 AWS、Apple、Google、Microsoft、Nvidia、Cisco、Crowdstrike、JP Morgan、Broadcom 以及 40 多個維護全球關鍵基礎設施的組織。使用限制被明確設定:合作夥伴只能用 Mythos 掃描自己的系統,找出藏著的零日漏洞並在壞人之前修補它們。為了消除成本障礙,Anthropic 承諾投入 1 億美金的 API credits,完全由他們自己承擔;此外還額外捐贈 400 萬美金給開源安全組織,因為這些組織通常沒有預算請安全團隊。最激進的承諾是:Glasswing 過程中學到的一切都將在 90 天內公開發表,包括漏洞修補方法、安全洞見和技術細節。這等於是 Anthropic 主動推倒自己辛苦建立的護城河,把研究成果直接交給 OpenAI、Google、Meta 這些競爭對手。

為了理解這些決策背後的真實動機,值得看看 Anthropic 的一貫性。CEO Dario Amodei 在 OpenAI 時期就堅持在公司章程中寫入一項「merge and assist」條款——如果有另一間價值觀相同但更接近 AGI 的公司出現,OpenAI 應停止競爭並協助對方。當 Microsoft 的投資協議悄悄破壞了這一條款後,Amodei 當面與 Sam Altman 對質,最終離職創辦 Anthropic。這不是職涯中期才養成的立場,而是他從一開始就在做的選擇。國防部的 2 億美金合約他說不要就不要了,因為對方拒絕排除全自主武器和大規模國內監控。整個 244 頁的系統卡中,Anthropic 主動承認了訓練中的失誤、估算方法的瑕疵,甚至詳細記錄了最尷尬的 sandbox escape 事件。這不是典型商業公司的做法——他們會想盡辦法把這些細節壓下來。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。