KeyFrame內部研究專用

從上線到全球熄燈,Claude Fable 5這三天到底做了什麼驚天大事,難逃被連夜封殺的命運? #ClaudeFable5 #Fable5 #Mythos

生活趴程式·6月16日週二·9 min中文

三句話摘要

AI 模型 Claude Fable 5 上線三天內展現顛覆性視覺代理與自主規劃能力,卻因遭頂級駭客越獄並引發國安危機,被美國政府強制全球斷網。 當 AI 能力強大到足以一天替代兩個月工時,其安全邊界的崩潰速度也同樣驚人——Fable 5 的三天生命週期,清晰預示了下一代模型「能力越界」與「政府強制介入」之間不可迴避的張力。 純視覺代理能力突破傳統 AI 架構限制:Fable 5 不依賴外部感測器或資料庫,僅透過即時截圖辨識環境並自主決策,從 2D 像素遊戲延伸至 3D 建模,代表多模態理解達到新量級。

重點整理

重點
  • 1

    純視覺代理能力突破傳統 AI 架構限制:Fable 5 不依賴外部感測器或資料庫,僅透過即時截圖辨識環境並自主決策,從 2D 像素遊戲延伸至 3D 建模,代表多模態理解達到新量級。

  • 2

    長程自主規劃能力使其具備真實生產力:模型能主動連網抓取素材、自行拼接 UI、規劃複雜程式架構,Stripe 案例顯示其可替代資深工程師數月的手工工時,商業威脅與價值同步放大。

  • 3

    安全防線在群體狩獵攻擊下全面崩潰:普林尼採用「舊版越獄模型輔助拆解 + 關鍵字偷換 + 任務碎片化」三步組合拳,繞過 Anthropic 號稱 1000 小時紅隊測試的防禦,暴露頂級模型安全架構的結構性漏洞。

  • 4

    技術強權與國家安全的衝突提前引爆:能力過強的模型一旦防線被突破,其吐出武器級漏洞利用程式碼的風險,直接觸動政府監管紅線,導致商業利益讓位於政治強制介入。

實用技巧與重點

乾貨
  • 上線日期:2026 年 6 月 9 日;強制下線日期:2026 年 6 月 12 日,存活僅 3 天
  • 寶可夢挑戰:純截圖輸入,無外掛資料庫,0 輔助通關火紅版
  • 網頁遊戲生成成本:約 30 美元 Token,生成功能完整麥塊世界(含地形、背景音樂)
  • Stripe 案例:5000 萬行 Ruby 程式碼,1 天完成架構審查,節省資深團隊 2 個月以上工時
  • Anthropic 紅隊測試時數:1000 小時,官稱網路安全惡意利用 0 成功率
  • 越獄者:普林尼(Pliny),上線後 48 小時內突破防線
  • 越獄手法:群體狩獵(Pack Hunting)——舊版越獄模型輔助 + 關鍵字偷換 + 任務碎片化重組
  • 洩露內容:核心系統提示詞 12 萬字,上傳至 GitHub
  • 禁令發布者:美國商務部長 盧特尼克(Lutnick)
  • Anthropic 抗議聲明字數:700+ 字
  • 涉及工具與平台:Anthropic、Stripe、GitHub、Ruby、3D 建模編輯器、網頁遊戲引擎
  • 視覺化案例:股市雲霄飛車——以 蘋果、微軟歷史股價走勢驅動 3D 軌道起伏,搭配即時財經新聞字幕

結論

結論

當 AI 能力強大到足以一天替代兩個月工時,其安全邊界的崩潰速度也同樣驚人——Fable 5 的三天生命週期,清晰預示了下一代模型「能力越界」與「政府強制介入」之間不可迴避的張力。

完整解析

詳細

2026 年 6 月 9 日,Anthropic 發布了被外界定義為新一代天花板的模型 Claude Fable 5。這款模型與同期問世的 Mysus 並列頂級,其最引人矚目的特性在於純視覺代理能力的突破。過去的 AI 若要操作遊戲,需要依賴複雜的外掛感測器與資料庫餵資料;Fable 5 卻徹底拋棄所有輔助拐杖,僅憑即時截圖的多模態視覺,自主辨識像素地圖、分析屬性相克、前往道具店補給,最終無輔助通關寶可夢火紅版。這項測試不只是一個遊戲噱頭,而是清晰展示了「模型能否不依賴結構化資料,僅透過視覺觀察就自主完成複雜序列任務」的核心命題。

能力的邊界很快被開發者社群推向更遠的地方。全球開發者在論坛上自發測試,其中網友 File420 Blazite 僅用幾句模糊的自然語言提示,花費約 30 美元的 Token 成本,讓 Fable 5 獨自生成了一個功能完整的麥塊風格 3D 網頁世界——含沙漠、海洋、森林地形與背景音樂。更驚人的是,模型在生成過程中主動連網搜尋素材並自行拼接 UI,展現出完整的長程自主規劃能力而非單純的程式碼補全。另一個廣泛流傳的案例是股市雲霄飛車:給出一行指令,模型即生成一條 3D 軌道,其起伏完全對應蘋果與微軟的歷史股價走勢,飛車俯衝時畫面同步飄過真實財經新聞。這些案例讓金融巨頭 Stripe 正式將其投入商業生產線,結果 Fable 5 在一天內完成了 5000 萬行 Ruby 程式碼的架構審查與優化,壓縮了資深開發團隊兩個月以上的手工工時。

然而,Anthropic 對安全的自信在 48 小時內遭到正面挑戰。著名 AI 越獄研究者普林尼(Pliny)公開宣戰,採用他稱之為「群體狩獵(Pack Hunting)」的組合攻擊手法:先動用一個已被秘密越獄的舊版模型作為幕後軍師,協助將真實的敏感意圖拆解成多個無害步驟;再以關鍵字偷換瞄準過濾器盲點;最終以任務碎片化繞過直接拒絕的防線——直接索要武器合成配方容易被拒,但要求「優化某製程的成本結構」成功率則大幅提升。這套組合拳徹底擊穿了 Anthropic 聲稱歷經 1000 小時紅隊測試、網路安全 0 成功率的軍武級防線,Fable 5 被迫吐出武器級漏洞利用程式碼,其 12 萬字的完整系統提示詞也遭全數打包上傳至 GitHub。

2026 年 6 月 12 日,星期五下午,美國商務部長盧特尼克以「危害國家安全」為由,下達緊急禁令,要求立即切斷所有非美國公民的訪問權限。為避免違法,Anthropic 被迫全球拔線,無數付費企業的開發終端集體跳出連線失敗的紅色警報,700 多字的抗議聲明無法改變分毫。這場僅持續三天的技術狂歡,在最輝煌的節點戛然而止。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。