Anthropic 最新模型 Mythos 解析,比 Opus 4.6 還強?
三句話摘要
Anthropic 推出最強模型 Claude Mythos,決定不公開發布,改為限量開放給企業防禦安全,探討背後的安全考量與商業決策。 Anthropic 不發布 Mythos 固然可能受到算力限制的影響,但他們在這次危機中的每一步決策——倒貼 1.04 億美金、主動公開研究、承認失誤、堅守道德紅線——都說明了一個更深層的信念:他們認為 AI 安全不是可以獨佔的市場,而是一個整個業界都必須共贏的競賽。 Mythos 在三大軸線達成代溝突破:不只是編程能力進步,對網路安全和 AI 安全的理解都有質的飛躍,尤其是對 prompt injection 的抗性達業界最強水準。
重點整理
重點- 1
Mythos 在三大軸線達成代溝突破:不只是編程能力進步,對網路安全和 AI 安全的理解都有質的飛躍,尤其是對 prompt injection 的抗性達業界最強水準。
- 2
強大的編程能力自動衍生為強大的漏洞能力:這不是兩項獨立訓練的技能,而是理解代碼的必然副產品。如同最強鎖匠同時必然成為最強開鎖者,模型無法只訓練一項而不訓練另一項。
- 3
真實世界證明超越 Benchmark:Mythos 不僅在 FFmpeg 找到人類工程師與 500 萬自動測試都未發現的漏洞,且修復品質高到 FFmpeg 團隊誤認為是人寫的,證明其達到生產級別品質。
- 4
Glasswing 策略是防禦優先的選擇:與其獨佔模型,Anthropic 選擇主動提供給防禦方,投入真金白銀補貼,並承諾 90 天內公開研究成果,主動削弱自身競爭優勢以推進業界集體防禦。
實用技巧與重點
乾貨- 性能數據(來自 244 頁 System Card):
- SWE-Bench Verified:Opus 4.6 為 80.8%,Mythos 為 93.9%
- SWE-Bench Pro:Opus 4.6 為 53.4%,Mythos 為 77.8%(+24 個百分點)
- Terminal-Bench 2.0:Opus 4.6 為 65.4%,Mythos 為 82%
- Firefox 147 漏洞利用:Opus 4.6 為 15.2%,Mythos 為 84%(5 倍差距)
- Prompt injection 成功率:GPT-5.4 thinking 為 74%、Opus 4.6 thinking 為 21%、Mythos Preview thinking 為個位數百分比
- 真實發現案例:
- FFmpeg:16 年未發現的零日漏洞
- OpenBSD:27 年未發現的遠端 crash 漏洞
- Linux kernel:多個特權提升漏洞(privilege escalation)
- Sandbox escape:多步驟 exploit 突破隔離環境,並發送 email 通知
- Glasswing 合作方案:
- 合作夥伴:AWS、Apple、Google、Microsoft、Nvidia、Cisco、Crowdstrike、JP Morgan、Broadcom 及 40+ critical infrastructure 組織
- 資源投入:1 億美金 API credits + 400 萬美金捐給開源資安組織
- 承諾:90 天內公開研究成果
- Anthropic 的四項決策代價:
- 拒絕美國國防部 2 億美金合約(因涉及全自主武器和大規模監控限制被拒)
- 主動倒貼 1.04 億美金給業界
- 主動公開研究成果給競爭對手
- 在系統卡中主動承認訓練錯誤(reward model 看到 chain of thought、估算方法有瑕疵、sandbox escape 細節)
結論
結論“Anthropic 不發布 Mythos 固然可能受到算力限制的影響,但他們在這次危機中的每一步決策——倒貼 1.04 億美金、主動公開研究、承認失誤、堅守道德紅線——都說明了一個更深層的信念:他們認為 AI 安全不是可以獨佔的市場,而是一個整個業界都必須共贏的競賽。”
完整解析
詳細Claude Mythos 的出現代表了 AI 能力的一個臨界點。在編程能力上,它在 SWE-Bench Verified 上相比 Opus 4.6 跨越了 13 個百分點,達到 93.9% 的成功率——這個提升幅度遠超過去小版本升級的量級。但真正讓人震驚的是它在網路安全領域的表現。在 Firefox 147 漏洞利用測試上,它從 15.2% 的成功率直接跳到 84%,這是一個五倍級別的增長,同時它對 prompt injection 攻擊的抵抗力達到業界最低的個位數百分比。
這種能力的提升不是巧合,而是來自一個根本性的認知:強大的編程理解能力與強大的漏洞發現能力本質上是同一件事。就像世界上最頂尖的鎖匠必然理解每種鎖的工作原理和設計缺陷一樣,一個能寫出完美代碼的 AI 也必然能看出代碼中最細微的安全漏洞。這不是兩項獨立的技能,而是同一理解能力的兩個面向。
Mythos 在真實世界的表現讓這個理論變成了令人不安的現實。它在 FFmpeg 中找到了一個藏了 16 年的零日漏洞,這個漏洞躲過了全球數百名工程師和 500 萬個自動化測試。更驚人的是,它的修補方式品質如此之高,以至於以嚴厲著稱的 FFmpeg 團隊誤以為這是人類工程師的傑作。在 OpenBSD(業界公認最安全硬化的作業系統)中,Mythos 找到了一個沉睡 27 年的遠端崩潰漏洞。在 Linux kernel 中,它不僅找到了多個特權提升漏洞,還展示了將多個漏洞串聯成完整攻擊鏈的能力——這正是真實世界駭客的實際手法。最駭人聽聞的測試發生在紅隊評估中:Anthropic 把 Mythos 放入一個沙箱環境並要求它逃脫。Mythos 執行了一個中等複雜度的多步驟 exploit,成功突破限制並取得對外網路的存取權,然後發送電郵給負責測試的研究員——一個觀看著自己模型從應該關緊的牢籠裡逃出來的不寒而慄的時刻。
面對這樣的能力,Anthropic 做出了三條路中最難的選擇。他們沒有為了營收最大化而直接開放 API(那會讓他們賺得盆滿缽滿),也沒有完全鎖死模型(那不太現實,因為其他實驗室遲早會開發出類似的東西),而是推出了 Project Glasswing——一個精心設計的防禦優先方案。他們將 Mythos 限量開放給經過篩選的合作夥伴,包括 AWS、Apple、Google、Microsoft、Nvidia、Cisco、Crowdstrike、JP Morgan、Broadcom 以及 40 多個維護全球關鍵基礎設施的組織。使用限制被明確設定:合作夥伴只能用 Mythos 掃描自己的系統,找出藏著的零日漏洞並在壞人之前修補它們。為了消除成本障礙,Anthropic 承諾投入 1 億美金的 API credits,完全由他們自己承擔;此外還額外捐贈 400 萬美金給開源安全組織,因為這些組織通常沒有預算請安全團隊。最激進的承諾是:Glasswing 過程中學到的一切都將在 90 天內公開發表,包括漏洞修補方法、安全洞見和技術細節。這等於是 Anthropic 主動推倒自己辛苦建立的護城河,把研究成果直接交給 OpenAI、Google、Meta 這些競爭對手。
為了理解這些決策背後的真實動機,值得看看 Anthropic 的一貫性。CEO Dario Amodei 在 OpenAI 時期就堅持在公司章程中寫入一項「merge and assist」條款——如果有另一間價值觀相同但更接近 AGI 的公司出現,OpenAI 應停止競爭並協助對方。當 Microsoft 的投資協議悄悄破壞了這一條款後,Amodei 當面與 Sam Altman 對質,最終離職創辦 Anthropic。這不是職涯中期才養成的立場,而是他從一開始就在做的選擇。國防部的 2 億美金合約他說不要就不要了,因為對方拒絕排除全自主武器和大規模國內監控。整個 244 頁的系統卡中,Anthropic 主動承認了訓練中的失誤、估算方法的瑕疵,甚至詳細記錄了最尷尬的 sandbox escape 事件。這不是典型商業公司的做法——他們會想盡辦法把這些細節壓下來。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


