Fable 5 is back
三句話摘要
Anthropic 重新部署改進版 Fable 5 並建立行業共識框架,應對 AI 模型的安全漏洞與網路安全風險。 Fable 5 的下架與重新部署不只是 Anthropic 的單獨事件,而是揭示了整個業界面臨的共同挑戰——建立統一的安全評估標準和政府監管框架,以在釋放強大模型能力與防止濫用之間找到平衡。 漏洞並非 Fable 特有問題:Amazon 發現的漏洞並不只存在於 Fable 5,包括較低能力的模型如 Kimi 2.7(開源模型)都暴露相同漏洞,這表示隨著更強大的開源模型發展,類似的限制措施可能會擴大。
重點整理
重點- 1
漏洞並非 Fable 特有問題:Amazon 發現的漏洞並不只存在於 Fable 5,包括較低能力的模型如 Kimi 2.7(開源模型)都暴露相同漏洞,這表示隨著更強大的開源模型發展,類似的限制措施可能會擴大。
- 2
多層防禦策略升級:Anthropic 不僅在模型層面進行微調,更重要的是改進分類器的嚴格程度,使原本允許 50% 良性請求的系統,現在會更激進地阻擋任何可能涉及網路安全的內容,形成多層防禦機制。
- 3
建立業界共識框架:當前業界缺乏統一的 jailbreak 嚴重性定義標準,導致應對混亂。Anthropic 與 Amazon、Microsoft、Google 等合作制定框架,從能力增益、應用廣度、易用性、可發現性四個維度評估漏洞,期望邀請 OpenAI 等其他機構參與。
- 4
政府關係深化與規範化:Anthropic 將與美國政府進行緊密合作,包括提前提供模型評估、快速分享安全資訊、聯合研究,以及推動自願性(但實質上將成為強制性)的安全評估標準,這預示著 frontier 模型的監管將趨於嚴格。
實用技巧與重點
乾貨- 時間節點:Fable 5 原定開放兩週,現改為一週;7 月 31 日重新部署
- 使用限制:訂閱用戶一週內限制 50% 的週度使用額度;之後需使用點數
- 受影響的模型:Claude Opus 4.8、GPT 5.5、Kimi 2.7 均存在類似漏洞
- 分類器改進:從允許 50% 良性請求的寬鬆策略,改為對網路安全相關內容的激進阻擋
- jailbreak 嚴重性評估維度:能力增益(Capability Gains)、應用廣度(Breadth of Capability Gain)、易用性(Ease of Urbanization)、可發現性(Discoverability)
- 合作公司:Amazon、Microsoft、Google、Glasswing 等
- 政府合作內容:提前評估、快速資訊共享、聯合研究、安全評估標準
結論
結論“Fable 5 的下架與重新部署不只是 Anthropic 的單獨事件,而是揭示了整個業界面臨的共同挑戰——建立統一的安全評估標準和政府監管框架,以在釋放強大模型能力與防止濫用之間找到平衡。”
完整解析
詳細6 月 12 日發布的 Fable 5 因其強大能力在網路安全領域表現出色,但隨即遭遇安全危機。Amazon 的研究人員發現了一種繞過其安全防護的方法,迫使 Anthropic 在短短數週後下架該模型。但值得注意的是,這個漏洞並非 Fable 5 獨有。經過驗證,包括 Claude Opus 4.8、OpenAI 的 GPT 5.5 以及中國的 Kimi 2.7 等能力相對較弱的模型都存在同樣的漏洞。這一發現揭示了一個關鍵問題:隨著開源強大模型的發展,類似的安全限制措施可能會普遍化。
Anthropic 的應對方案是多管齐下的。在模型層面,他們訓練 Fable 5 對網路安全相關請求進行拒絕。更關鍵的是,他們重新設計並改進了部署在模型上方的分類器。原本這個分類器的安全邊界較寬,允許約 50% 的網路安全相關查詢通過。新版本則採取激進的策略,任何分類器認定可能涉及網路安全的內容都會被阻擋。這意味著用戶將遇到更多的拒絕,即使是一些良性的請求也可能被誤判。Anthropic 將此與其他防禦層相結合,包括細粒度的規則和持續更新,以應對新型的 jailbreak 技術。
更宏觀的層面上,Anthropic 認識到業界缺乏統一的 jailbreak 評估標準,導致當新漏洞被發現時,開發者和政府都無法達成共識。為解決這一問題,他們與 Amazon、Microsoft、Google 以及 Glasswing 等企業合作,制定了一套共識框架。該框架從四個維度評估漏洞的嚴重性:能力增益(漏洞能否讓模型超越現有工具)、應用廣度(漏洞對多少種不同任務有效)、易用性(需要多少專業知識)和可發現性(有多容易被發現)。Anthropic 邀請包括 OpenAI 和其他實驗室在內的所有業界夥伴參與,希望這套框架能為整個生態帶來更多透明度。
最後,Anthropic 宣佈將與美國政府進行更深層次的合作,包括在 frontier 模型的預發布階段提供政府評估、快速分享安全信息、聯合開展 AI 安全研究,以及推動建立業界統一的自願性安全評估標準。雖然名義上是「自願」,但實際上這將成為提供高能力模型的政府要求。這表明 AI 模型的監管正走向更正式、更規範化的時代。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


