KeyFrame內部研究專用

Anthropic 官方認證:Claude Fable 5 太強大,我們不敢全面開放!😱

獨特見解·6月11日週四·25 min中文

三句話摘要

Claude Fable 5 的發布不是單純的模型升級,而是 Anthropic 為前沿 AI 建立分級釋放制度的治理實驗。 --- Claude Fable 5 真正的意義不在於它有多聰明,而在於它標誌著 AI 行業從「比誰更會說話」轉向「誰能把前沿能力安全嵌入生產閉環」的新競爭時代——能力越強、門檻越高、限制越多,而最強的能力將只屬於少數付得起也整合得了的組織。 能力分級釋放取代全面開放

重點整理

重點
  • 1

    能力分級釋放取代全面開放

  • 2

    Anthropic 將 Fable 5 與 Mythos 5 設計為雙軌制,Mythos 保留完整能力、僅供可信網路安全與關鍵基礎設施合作夥伴使用,Fable 5 則是加上安全限制後面向公眾的商業版,這種結構很可能成為未來前沿模型發布的標準模板。

  • 3

    長周期自主執行改變軟體工程分工

  • 4

    Fable 5 的核心突破不在單次問答,而在於能像工程師一樣接收複雜任務後自行拆解、調用工具、執行測試、發現錯誤再修正,真正從「代碼補全工具」轉型為「數位工程師」,壓縮的是需求至交付之間的人力成本,而非寫幾行函式的能力。

  • 5

    動態路由是新型安全機制,不是一刀切拒絕

  • 6

    過去大模型遇敏感詞直接拒絕、容易誤傷正常用戶,Fable 5 改用分類器判斷風險等級,只有網路安全、生物化學、模型蒸馏等高風險請求才降級處理,普通用戶大多數情況下仍可使用完整能力,這是從「拒絕」到「降級」的架構轉變。

  • 7

    安全敘事與商業敘事深度綁定

  • 8

    Anthropic 的安全設計同時服務兩個目的:向企業客戶證明模型可進入生產環境,也向監管機構與資本市場展示風險可控。30 天資料留存、Project Glasswing、可信訪問分級,既是真實的安全措施,也強化了品牌稀缺感與行業定價權。

  • 9

    --

實用技巧與重點

乾貨
  • 具體數字與比例
  • Project Glasswing 覆蓋 15 個以上國家、約 150 家組織
  • 領域:電力、水務、通訊、醫療、硬體、開源軟體維護
  • 超過 95% 的會話不觸發安全回退機制
  • Stripe 案例:5000 萬行 Ruby 程式庫遷移,AI 約一天完成,人工約兩個月
  • API 定價:輸入 $10/百萬 token、輸出 $50/百萬 token(Opus 4.8 的 2 倍)
  • 資料保留期限:30 天,用於安全監測,聲明不用於訓練
  • 模型與平台名稱
  • Claude Fable 5(公眾版)
  • Claude Mythos 5(完整能力版,限可信合作夥伴)
  • Claude Opus 4.8(高風險請求的回退模型)
  • Project Glasswing(可信合作夥伴計畫)
  • 技術機制
  • 動態路由機制(Dynamic Routing):分類器判斷請求風險等級後決定使用 Fable 5 或回退至 Opus 4.8
  • FSD 模組:採用強化學習技術,讓模型透過與環境交互學習生成文字
  • 高風險路由觸發條件:網路安全攻擊路徑分析、生物化學設計、模型蒸餾嘗試
  • 能力展示
  • 視覺能力:從複雜科學圖表抽取精確數字、根據截圖重建 Web 應用原始碼
  • 以視覺方式通關《寶可夢火紅》(過去 Claude 需複雜輔助系統才能完成)
  • 生物推理:在病毒相關設計任務中超越部分專門蛋白質語言模型
  • 風險分類項目
  • 網路安全攻擊輔助
  • 危險生物/化學設計
  • 模型蒸餾(大量調用強模型以提取能力訓練競爭模型)
  • --

結論

結論

Claude Fable 5 真正的意義不在於它有多聰明,而在於它標誌著 AI 行業從「比誰更會說話」轉向「誰能把前沿能力安全嵌入生產閉環」的新競爭時代——能力越強、門檻越高、限制越多,而最強的能力將只屬於少數付得起也整合得了的組織。

完整解析

詳細

Anthropic 發布 Claude Fable 5 的邏輯,與過去任何一次大模型發布都不同。過去發布新模型,公司習慣強調更快、更強、更會寫程式,但這次 Anthropic 的核心訊號是:這個模型太強,必須分級釋放。Fable 5 與 Mythos 5 共享同一底層能力體系,Mythos 更接近完整能力,透過 Project Glasswing 僅開放給超過 15 個國家、約 150 家可信組織,涵蓋電力、水務、通訊、醫療等關鍵基礎設施領域。Fable 5 則是加上安全護欄後的公眾商業版,本質上是「帶著安全鎖的 Mythos」。這麼設計的原因很現實:Mythos 級別的模型在網路安全領域已不只是解釋程式碼,而是能主動協助防禦團隊發現複雜漏洞、理解攻擊路徑,同樣的能力若被惡意使用,可能大幅降低網路攻擊門檻。

為了在安全與能力之間取得平衡,Fable 5 引入了動態路由機制。當請求涉及網路安全攻擊路徑、生物化學設計或疑似模型蒸餾時,系統分類器自動將任務回退給更保守的 Opus 4.8,而非直接拒絕。官方數據顯示超過 95% 的會話不會觸發回退,也就是說絕大多數用戶依然能體驗完整能力。這是從過去粗暴的一刀切拒絕,進化為分層處理的安全架構。同時,Anthropic 要求 Fable 5 與 Mythos 5 強制保留 30 天的輸入與輸出內容,用於安全監測、發現新型越獄攻擊,並聲明不用於模型訓練。這項政策已引發企業端對客戶資料、商業機密與合規風險的緊張,尤其金融、醫療、政府等行業本就對資料留存高度敏感,這讓「更強能力」與「更嚴審查」之間的矛盾更加明顯。

在能力層面,Fable 5 最關鍵的突破不在單次問答,而在長周期自主執行。它能在代理系統中持續工作,自行規劃步驟、調用工具、執行測試、發現錯誤後繼續修正,甚至用視覺能力對照截圖檢查自己產生的介面是否符合目標。Stripe 的測試案例最具代表性:Fable 5 在一個 5000 萬行 Ruby 程式庫中完成大規模遷移,約一天完成,人工團隊手動操作可能需要兩個多月。這不代表 AI 萬能,不同程式庫的難度差距極大,但趨勢已清晰:AI 正在從「寫幾段程式碼」進入「處理系統工程」,開始像一名能連續工作的數位工程師。知識工作同樣受到衝擊,金融分析、文件推理、圖表理解等高度耗時的白領任務,也在 Fable 5 的能力範圍之內。對企業而言,若模型能把幾天的資料整理壓縮到幾小時,即使 API 每百萬 token 輸出要價 $50,也可能比人力便宜。

從更大的格局看,Fable 5 不只是一次模型發布,而是一套 AI 治理實驗的公開展示。前沿模型公司正在演變為新型基礎設施守門人:他們決定誰能訪問哪些能力、哪些任務屬於高風險、哪些資料必須留存、哪些研究可以進行。Anthropic 的雙軌制——公眾版 Fable、可信夥伴版 Mythos——很可能成為未來所有前沿模型發布的雛形。當 AI 能夠改變軟體工程、金融分析、科學研究與網路安全,它就不再是消費級應用,而是影響現實世界安全邊界的基礎設施。完全不放,技術價值無法釋放;完全放開,一旦出事整個行業都會迎來更嚴厲監管。於是中間路線出現了:公眾用受限版、可信夥伴用增強版、高風險場景被路由、資料被留存、訪問被分級、價格也被抬高。Anthropic 的安全敘事與商業敘事深度綁定,安全設計既是真實考量,也同時強化了品牌稀缺感與行業定價權,兩者並不矛盾。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。