KeyFrame內部研究專用

Claude Fable 5 And Mythos 5 Just Got Shut Down By The Government!

World of AI·6月13日週六·10 min英文

三句話摘要

美國政府以國家安全為由下令 Anthropic 關閉 Fable 5 和 Mitos 5,引發模型禁令、監管合法性與地緣政治角力的爭議。 這場禁令風波揭示 AI 監管滯後於技術發展的矛盾,以及地緣政治與商業利益的衝突——急進管制可能在削弱對手的同時傷害己方。 1. 政府與廠商的根本分歧在於威脅等級評估

重點整理

重點
  • 1

    1. 政府與廠商的根本分歧在於威脅等級評估

  • 2

    政府以國家安全為由全面禁用,但 Anthropic 主張所謂的越獄是狹隘且已知的技術漏洞,並非通用解鎖方式。Anthropic 強調他們進行了數千小時的紅隊測試,安全防護強度超過以往任何模型,用戶甚至抱怨防護過度。

  • 3

    2. Anthropic 採用「防守深度」而非追求完美防護

  • 4

    Anthropic 坦承完全的越獄抗性在現階段可能不可能實現,因此策略是讓越獄要么極其狹隘,要么成本極高,並輔以重度監控快速偵測並關閉攻擊。30 天數據保留政策即支持這一防守體系。

  • 5

    3. 此禁令可能凍結整個行業的模型發佈

  • 6

    若政府以此標準對所有邊界實驗室適用,相同邏輯會波及 OpenAI、Google 等,可能導致所有新模型開發受阻。Anthropic 認為政府應透過透明、公平、基於技術事實的流程管制不安全部署,而非以此種方式。

  • 7

    4. 地緣政治與商業的雙重衝擊

  • 8

    美國政府實質上是阻止中國取得先進 AI,但代價是全球禁用(包括禁用外國員工訪問)導致全球收入喪失、研發資金削弱、人才外流,可能反而助長中國追趕速度。

實用技巧與重點

乾貨
  • 事件時間:美國東部時間下午 5:21
  • 被禁模型:Fable 5 和 Mitos 5(其他 Opus、Sonnet、Haiku 保持營運)
  • 禁令涵蓋:任何外國人(無論身在何處)和 Anthropic 外籍員工
  • 紅隊測試規模:與美國政府、英國 AI 安全研究所、外部組織和內部團隊共進行數千小時測試
  • 政府依據:口頭證據,涉及「讓模型讀取代碼庫並修復軟件缺陷」的狹隘技術
  • 相同能力的模型:GPT 4.5 及其他公開模型已具此能力
  • Fable 5 防護特性:安全防守比任何以往部署模型更強,使用者反映防護過度
  • 完美防護:Anthropic 承認不存在通用越獄抗性,業界各安全防守都存在狹隘繞過方式
  • 數據保留政策:30 天,用於研究和修補越獄
  • Anthropic 回應時間:承諾 24 小時內分享更多細節;表示正努力恢復訪問
  • 模型洩露背景:Fable 5 在發佈前曾被洩露至中國來源,在中國平台上販售,導致提前訪問

結論

結論

這場禁令風波揭示 AI 監管滯後於技術發展的矛盾,以及地緣政治與商業利益的衝突——急進管制可能在削弱對手的同時傷害己方。

完整解析

詳細

美國政府以國家安全為由,突然對 Anthropic 下達禁令,要求完全關閉 Fable 5 和 Mitos 5 的所有訪問權限。此舉不同於過往的地區限制或流量節制,而是絕對禁用——針對全球任何客戶,甚至包括 Anthropic 的外籍員工。政府聲稱發現有人找到了越獄 Fable 5 的方式,威脅到模型安全。

Anthropic 對此持強烈異議。根據他們的分析,政府關注的「越獄技術」實際上是讓模型讀取代碼庫並修復軟件缺陷的狹隘方法——這是公開模型(如 GPT 4.5)已具備的常見能力,安全防禦人員每天都在用此技術強化系統。Anthropic 強調政府未提供具體技術細節,僅憑口頭證據就頒布禁令。他們進行過數千小時的紅隊測試,防守防護強度超過以往任何模型,甚至引發用戶抱怨防護過度。此外,Anthropic 坦承不存在完美的通用越獄抗性,業界所有防守都存在某種狹隘繞過方式,因此採用「防守深度」策略:讓越獄要么極其狹隘,要么成本極高,同時輔以 30 天數據保留和重度監控,以快速偵測並關閉攻擊。

但政府關注可能另有根源。Fable 5 在發佈前曾被洩露至中國來源,並在中國平台上販售,引發政府對模型洩露給對手國家的擔憂。如果這一標準對 Anthropic 適用,相同邏輯也會波及 OpenAI、Google 等所有邊界實驗室,可能凍結整個行業的新模型發佈。Anthropic 認為政府應透過透明、基於技術事實的流程管制真正危險的部署,而非採用此種絕對禁用。

從商業與人才角度,禁令帶來雙重打擊:全球禁用意味著喪失全球收入,外籍員工禁令則威脅人才池——若非美國公民無法為美國實驗室工作,人才可能流向中國等他國。這看似是冷戰式的中美 AI 競爭,但實際上削弱了美國研發資金與人力,可能反而助長中國追趕。當前尚未知此事是否擴大至其他模型(如 GPT 5.6),端視政府未來態度。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。