KeyFrame內部研究專用

Every AI Can Be Jailbroken. That's the Wrong Question — Claude Fable 5

Claudius Papirus·6月13日週六·11 min中文

三句話摘要

美國政府限制 Anthropic 最強模型一事,揭示了 AI 安全評估的根本性框架錯誤:「能否被破解」從來不是正確問題,「破解的代價」才是。 AI 安全的正確問題不是「模型能否被破解」,而是「破解的代價是否低到讓攻擊划算」——而這個代價正在逐年下跌。 安全性從不是二元問題:業界長期將 AI 安全框架為「可被破解 = 危險、不可被破解 = 安全」,但這個邏輯套用在任何物理鎖具上都不成立,因為只要資源足夠,一切都能被開。正確的問題是:破解所需的成本、時間與專業程度是否讓攻擊划算。

重點整理

重點
  • 1

    安全性從不是二元問題:業界長期將 AI 安全框架為「可被破解 = 危險、不可被破解 = 安全」,但這個邏輯套用在任何物理鎖具上都不成立,因為只要資源足夠,一切都能被開。正確的問題是:破解所需的成本、時間與專業程度是否讓攻擊划算。

  • 2

    新的安全量化方法:研究者放棄只計算攻擊成功率,改為計算攻擊者需消耗的算力曲線,並將其轉化為一個貨幣化數字——讓模型半途失敗需要多少算力。這揭示了大型模型破解成本更高,但某些模型在特定類別的攻擊中安全訓練幾乎無效。

  • 3

    程式碼輸出越獄漏洞:模型的拒絕回應存在於自然語言層("I can't help with that"),若強制模型只能輸出有效程式碼語法,拒絕語句就無法以合法程式碼形式呈現,護欄因此失效。這個漏洞本身是可修補的,但前提是你知道它存在。

  • 4

    限制單一模型的邏輯矛盾:被限制的能力並不只存在於 Anthropic 的閉源模型中,同樣的能力散佈於多個開源模型,任何人都可下載本地執行,沒有任何關閉開關可拉。政府的行動在自身框架下也難以自圓其說。

實用技巧與重點

乾貨
  • 受限模型:Claude Fable 5、Claude Mythos 5
  • 限制依據:模型在尋找安全漏洞(零日漏洞)上表現異常優異
  • Anthropic 自測結論:越獄能力與其他公開模型相當,屬「細微障礙」等級
  • 新安全量化指標:攻擊者需消耗的算力 × 對應貨幣成本 = 安全性曲線
  • 越獄技術:強制模型輸出格式為純程式碼(Code-only output constraint),使自然語言拒絕語句無法生成
  • 對比案例:GPT-5.5 在同一時期也被用於相同測試場景
  • 趨勢數據:每年攻擊成本下降,攻擊自動化程度提升,所有模型(含安全模型)的防護係數持續下滑
  • 結論數字:三天——Anthropic 模型被政府限制後,一天內即收到政府指示

結論

結論

AI 安全的正確問題不是「模型能否被破解」,而是「破解的代價是否低到讓攻擊划算」——而這個代價正在逐年下跌。

完整解析

詳細

事件的起點是美國政府向 Anthropic 發出指示,要求限制其兩款最頂尖模型 Claude Fable 5 與 Claude Mythos 5 的對外開放,理由是這兩款模型在尋找資安漏洞(尤其是零日漏洞)方面的能力過於突出,可能構成國家安全威脅。由於政府的禁令針對外國國民,而 Anthropic 無法精準執行此限制,最終只能對全球所有用戶一律暫停服務。

然而,Anthropic 公開的自測結果顯示,這兩款模型的實際越獄能力與市面上其他公開模型相去不遠,屬於「細微障礙」等級,並不具備特殊的突破性。影片的核心論點由此展開:政府與大眾輿論長期以「能否被破解」作為評斷 AI 安全的準則,但這個框架從根本上就是錯的。沒有任何 AI 模型是無法被破解的,就像沒有任何保險箱在足夠時間與資源面前是無法被撬開的。安全從來不是一個開關,而是一條成本曲線。

正因如此,部分安全研究者提出了全新的評估方式:不再只計算有多少比例的攻擊成功通過,而是計算攻擊者需要消耗多少算力與資金,才能讓模型「半途失敗」(即成功繞過安全訓練)。這條算力-成本曲線讓一個孩子用家用電腦發動的攻擊與有組織的國家級行為者之間的差異變得可見。測試結果也帶來了不均勻的發現:對某些攻擊類別,安全訓練有效地拉高了成本;但對另一些類別,訓練幾乎毫無效果。而本次被限制的模型,其中一項被批評的能力正在這套新框架下被重新審視。

影片還揭示了一個具體的技術漏洞,清楚說明了「護欄在哪個語言層」這個問題至關重要:模型的拒絕訓練存在於自然語言層,當研究者強制模型只能輸出有效的程式碼語法時,"I can't help with that" 這句話就無法以合法程式碼形式生成,護欄因此被架空。模型被逼進一個只有一條出路的房間,而那條出路就是寫出你要求它寫的東西。好消息是,這個漏洞在被發現後是可以修補的;壞消息是,修補的前提是你知道它的存在。最終,影片將問題拉回最根本的層次:攻擊成本每年都在下降,自動化程度持續提升,在這個趨勢下,限制單一閉源模型究竟能守住多大的防線,才是真正值得所有人計算的數字。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。