KeyFrame內部研究專用

Claude Fable 5 首发实测,真是太烧了。。完爆 GPT 5.5!#ai编程 #ai #claude #程序员 #编程

Programmer Fish Skin·6月10日週三·9 min中文

三句話摘要

Claude Fable 5 實測報告:以兩輪 AI 編程任務對比 GPT-5.5 與 Opus 4.8,驗證其「最貴但最能交付」的定位。 --- Fable 5 是目前 AI 編程中「唯一能一次交付可用產品」的模型,但其成本是競品的 3–8 倍,適合預算充足、對交付品質要求極高的場景,而非所有人的日常首選。 安全護欄設計決定了模型的受眾邊界:Fable 5 內建安全分類器,遇到網路安全、生化或模型蒸餾等敏感請求時會自動降級至 Opus 4.8;Mythos 5 移除護欄,僅開放給官方審核過的機構,普通用戶無法取得。

重點整理

重點
  • 1

    安全護欄設計決定了模型的受眾邊界:Fable 5 內建安全分類器,遇到網路安全、生化或模型蒸餾等敏感請求時會自動降級至 Opus 4.8;Mythos 5 移除護欄,僅開放給官方審核過的機構,普通用戶無法取得。

  • 2

    任務越長越複雜,Fable 5 的優勢越明顯:官方以 Stripe 5000 萬行 Ruby 代碼庫為例,Fable 5 一天完成了團隊原本需要兩個月的遷移工作;短平快的 demo 無法反映真實差距,長程任務才是分水嶺。

  • 3

    Fable 5 的高成本源於它真的願意「多做」:它是三個模型中唯一進行終端互動式測試的,花費大量輪次在 TUI 交互調試上,而這些額外投入正是它能交付可用產品的根本原因。

  • 4

    三個模型呈現明確差異化定位:GPT-5.5 追求速度與成本效益;Opus 4.8 兼顧代碼品質與成本;Fable 5 追求極致交付品質,代價是最高的費用。

  • 5

    --

實用技巧與重點

乾貨
  • 定價
  • Fable 5:輸入 $10 / 百萬 token,輸出 $50 / 百萬 token
  • 是 Opus 4.8 的 2 倍,DeepSeek V4 的約 50 倍
  • 比先前的 Mythos Preview 便宜超過一半
  • 模型版本
  • Claude Fable 5:公開版,含安全分類器,敏感請求降級至 Opus 4.8
  • Mythos 5:完整版,無護欄,僅供官方審核的網路安全機構與少數生物研究人員
  • 測試案例 1 — TaskFlow 全棧任務
  • 工具:Cursor(已第一時間接入 Fable 5)
  • 包含 7 個功能需求,3 個模型相同 Prompt,全開 High thinking,零人工干預
  • Fable 5:唯一零修改通過 TypeScript 編譯、後端一次啟動成功、全部 API 測試通過
  • Opus 4.8:代碼品質較高但 UI 較樸素
  • GPT-5.5:速度最快,但任務列標題出現英文,細節缺失
  • 測試案例 2 — 重構 Claude Code(Yupi Code)
  • 材料:Claude Code 洩露的 50 萬行工業級 Agent 源碼
  • 任務:自主分析架構,從零重構可在終端運行的命令列 AI 編程助手
  • Fable 5:直接讀取本地 Claude 配置,複用 DeepSeek 模型,無需填 API Key,一次交付可用,普通對話 / Agent 模式 / 工具調用全部正常
  • Opus 4.8:透過 Mock Server 跑通測試,但實際運行需要 Anthropic API Key,UI 顯示異常
  • GPT-5.5:速度最快,但同樣需要 API Key,介面簡陋,Read 工具直接報錯
  • 成本對比(單次長程任務)
  • Fable 5:約人民幣 200 元
  • Opus 4.8:約 Fable 5 的 1/3
  • GPT-5.5:約 Fable 5 的 1/8
  • 真實案例數據
  • Stripe:5000 萬行 Ruby 代碼庫,Fable 5 一天完成原本需要 2 個月的遷移
  • 功能對比矩陣關鍵項目(Fable 5 獨有)
  • Ink TUI 完整實現
  • 上下文壓縮
  • 自動複用本地配置
  • --

結論

結論

Fable 5 是目前 AI 編程中「唯一能一次交付可用產品」的模型,但其成本是競品的 3–8 倍,適合預算充足、對交付品質要求極高的場景,而非所有人的日常首選。

完整解析

詳細

Claude Fable 5 的發布背景建立在一個清晰的市場定位上:它與 Mythos 5 共享同一個底層模型,能力完全一致,差異只在安全護欄的鬆緊程度。Fable 5 面向一般用戶,遇到網路安全、生化研究或模型蒸餾等敏感請求時,系統會自動降級至 Opus 4.8 並給出提示;Mythos 5 則拆除了所有護欄,僅開放給通過官方審核的機構。定價方面,Fable 5 每百萬輸入 token $10、輸出 $50,是 Opus 4.8 的兩倍,也是目前主流模型中定價最高的,儘管官方強調這已比前一個 Mythos Preview 版本便宜了超過一半。

為了驗證「貴得值不值」,測試者設計了兩輪對比:第一輪是開發含 7 個功能需求的全棧任務管理看板 TaskFlow,測試 UI 審美、編碼能力與工程可靠性。三個模型使用完全相同的 Prompt,全程開 High thinking 且零人工干預。結果顯示,UI 風格上 Fable 5 配色協調、狀態分區清晰;工程品質上,Fable 5 是唯一一次通過 TypeScript 編譯、後端一次啟動成功、所有 API 測試一次通過的模型,真正做到開箱即用。GPT-5.5 雖然速度最快,但細節上出現英文標題等問題;Opus 4.8 排版工整但 UI 較為樸素。

第二輪測試才是真正的壓力測試。測試者以 Claude Code 洩露的 50 萬行工業級 Agent 源碼為材料,要求三個模型自主分析架構並從零重構一個能在終端實際運行的命令列 AI 編程助手「Yupi Code」。Opus 4.8 透過 Mock Server 完成測試流程,自主驗證層次最多,但實際運行需要 Anthropic 的 API Key,且修復後 UI 顯示仍有問題;GPT-5.5 完成速度最快,但同樣卡在 API Key 需求上,介面極為簡陋,基本的 Read 工具甚至直接報錯。Fable 5 則直接讀取了測試者本地的 Claude 配置,自動複用已設定好的 DeepSeek 模型,無需手動填入任何 Key,交付後普通對話、Agent 模式、工具調用全部正常,體驗與原版 Claude Code 幾乎一致。

最終的成本揭露令人驚訝:這一次長程任務,Fable 5 的費用約人民幣 200 元,是 Opus 4.8 的 3 倍、GPT-5.5 的 8 倍。高費用的主要原因是思考 token 的消耗,以及 Fable 5 在 TUI 互動調試上投入了大量輪次。然而,正是這些「多做」的輪次,讓它成為三個模型中唯一交付可用產品的選手。從可視化分析報告來看,Fable 5 在驗證深度與實測可用性上遙遙領先,Opus 4.8 在工程代碼品質上略勝一籌,GPT-5.5 則全面墊底。測試者的建議是:GPT-5.5 適合追求速度與成本的場景,Opus 4.8 適合兼顧品質與成本的日常需求,Fable 5 則適合需要極致交付品質、且預算充足的任務,最貴的不一定是最適合你的。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。