KeyFrame內部研究專用

Claude Fable 5 首发实战:贵、慢、没有实际提升!

碳基生物退役指南·6月10日週三·7 min中文

三句話摘要

實測 Claude「Fable 5」模型 8 小時:貴、慢、平庸,普通用戶幾乎沒有升級價值。 Fable 5 是為燒得起錢的大企業打造的模型,普通用戶花同樣的錢在現有模型上,實際體驗不會更差甚至更好。 定價策略針對企業,非一般用戶:Fable 5 連 200 美元訂閱用戶每月也只有 12 天額度,超出需額外付費,官方社群反應強烈。這顯示 Anthropic 的商業目標是大型企業 API 用量,而非個人訂閱市場。

重點整理

重點
  • 1

    定價策略針對企業,非一般用戶:Fable 5 連 200 美元訂閱用戶每月也只有 12 天額度,超出需額外付費,官方社群反應強烈。這顯示 Anthropic 的商業目標是大型企業 API 用量,而非個人訂閱市場。

  • 2

    安全過濾過度激進,誤傷日常任務:社群中出現大量因觸發生物、安全或健康規則而被降級處理的案例,連「貪吃蛇」和超市採購清單都中招,說明模型的安全邊界設定嚴重影響實用性。

  • 3

    工程實戰表現中規中矩,非宣傳中的突破性能力:3D 效果實作尚可,但桌面/行動端適配、UI 排版、中文文字品質均未超越既有模型,符合「能省就省」的保守輸出策略。

  • 4

    能力多體現在官方展示情境,普通用題難以激發:講者推測 Fable 5 的優勢場景需要極複雜的任務才能體現,而大多數用戶的日常需求根本達不到這個門檻。

實用技巧與重點

乾貨
  • 發布後 30 分鐘 API 速度:0.3 Token/秒
  • 支援平台:Anthropic 自家 API、AWS、Azure、Google(四個 official provider)
  • 赛博盘串專案總花費:14 美元(約 100 人民幣),含初期 400 錯誤浪費的 2.5 美元
  • 初期 400 錯誤空耗:2.5 美元(18 人民幣),尚未完成任何實際工作
  • 專案完成耗時:4 小時等待 + 17 分鐘生成
  • 訂閱限制:200 美元/月 Max 方案僅含 12 天 Fable 5 使用量,超出需額外付費
  • Token 消耗案例:某用戶 5 分鐘燒光 Max 訂閱 5 小時額度,估計月費可達數千美元
  • 被攔截任務案例:貪吃蛇(成功率不穩定)、Costco 豬肉漢堡採購清單、羊的 RNA 序列分析
  • 比較模型:Kimi 2.6、Claude Sonnet 4.6、Claude Opus 4.7/4.8、本地 Qwen 3.6
  • SVG 插畫測試:Fable 5 優於 Sonnet 4.6,但審美不及 Kimi 2.6
  • 中文寫作:約等同 Claude 4.6 水準,低於預期

結論

結論

Fable 5 是為燒得起錢的大企業打造的模型,普通用戶花同樣的錢在現有模型上,實際體驗不會更差甚至更好。

完整解析

詳細

Anthropic 發布代號「Fable 5」的新模型後,市面上隨即充斥大量炫目演示。講者花費 8 小時、實際消費逾百元人民幣進行實測,得出的核心結論卻是:這個模型貴、慢、且對普通用戶幾乎沒有明顯提升。模型發布後 30 分鐘,API 速度僅有 0.3 Token/秒,儘管背後接了 Anthropic、AWS、Azure、Google 四大雲端供應商,仍顯示上線準備相當倉促、模型對算力的消耗極為可觀。

講者以一個原創高難度專案「賽博盤串」進行壓力測試,要求模型根據自定義設計文件實作帶有 3D 效果、油潤質感、用戶進度與排行榜的全端應用。然而一開始便連遭 400 錯誤,模型自承尚未開始任何實際工作,卻已在重試迴圈中燒掉 2.5 美元。等待四小時後重啟,才順利在 17 分鐘內完成,總花費 14 美元。成品的 3D 手串桌面效果尚可接受,但標題文字錯誤、副標題排版簡陋、手串無法連續旋轉一圈,行動版更是完全翻車——3D 模型無法完整顯示,觸控互動也失效。設計文件中明確要求桌機與行動端雙重適配,最終仍出現「顧了桌面忘了行動」的注意力缺失問題。

社群層面的反映同樣值得警惕。官方發布貼文底下訂閱用戶怨聲載道,案例包括:輸入「人類」兩個字被安全機制降級、請模型做貪吃蛇遊戲被拒、列超市採購清單被攔、分析羊的 RNA 序列因生物安全規則遭封鎖,醫療與健康諮詢更是重災區。講者隨機驗證其中幾個案例,貪吃蛇確實能生成,但品質甚至不如本地部署的 Qwen 3.6;SVG 插畫表現優於 Sonnet 4.6 但遜於 Kimi 2.6;中文創意寫作則約回到 Claude 4.6 的水平,整篇敘事四平八穩,結尾套路明顯,無驚喜可言。

定價結構進一步壓縮了普通用戶的使用誘因:即便是 200 美元/月的 Max 訂閱,Fable 5 的使用量僅涵蓋約 12 天,超出需額外付費;已有用戶回報 5 分鐘燒光 5 小時配額,換算月成本可能高達數千美元。講者的結論是,Fable 5 的能力優勢更多體現在官方精心設計的展示情境,或需要極度複雜任務才能激發,對於只需要日常工作中省心省力的一般用戶而言,這個模型在性價比上顯得相當平庸。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。