【Opus 5实战测评】性能超强!价格超高!
三句話摘要
評測 Claude Opus 5 模型的性能表現、成本效益,以及對其公司歷史決策的批評。 Claude Opus 5 技術上毫無疵疵,但過高的成本、冗長的審查,以及缺乏相比 GPT 的獨特優勢,讓它對開發者而言不具競爭力。 Claude 的歷史決策形成惡性循環。公司創立時以「安全」為賣點,後來推出強大的 Messos 5 卻因政府安全顧慮下架,再加上變態級的安全限制,導致用戶逃往 GPT。Opus 5 是公司被迫降低審查強度的妥協產物,因為如果繼續採用 Fable 那種審查力度已經沒有客戶了。
重點整理
重點- 1
Claude 的歷史決策形成惡性循環。公司創立時以「安全」為賣點,後來推出強大的 Messos 5 卻因政府安全顧慮下架,再加上變態級的安全限制,導致用戶逃往 GPT。Opus 5 是公司被迫降低審查強度的妥協產物,因為如果繼續採用 Fable 那種審查力度已經沒有客戶了。
- 2
Opus 5 的技術能力確實紮實,單次題目多數一次到位或修改次數少(如 APK 簽名題改兩次通過、網站只改 5 個檔案),但整體 Token 消耗量比 GPT 多 50%,加上原本就比 GPT 價格高,導致使用成本遠高於競品。
- 3
安全審查實施方式改變了。Opus 5 與 Fable 5 都引入了第三方安全分類器(用另一個模型監視對話),相比舊版本的自我判斷更難被提示詞工程繞過;但 Opus 5 的分類器強度沒有 Fable 那麼極端,只在涉及記憶體或互可等特別敏感領域拒答,正常開發問題通常放行。
- 4
講者認為沒有選擇理由。同等性能下,為何花更多錢用一個審查更多的服務,而不選審查更少又更便宜的 GPT 5.6 Turbo?除非有特殊優勢,否則 Opus 5 對他這類開發者而言是劣選。
實用技巧與重點
乾貨- 測評環境與成本
- 平台:OpenRouter
- API 格式:OpenAI 相容
- 推理強度:最高
- Token 上限:100 萬
- 總花費:$48.5 美元
- 測評時長:約 10 小時,成本超過 $200 美元
- 7 道測試題與費用
- Lua 代碼反向:$2.16
- APK 簽名驗證(修改 2 次通過):$1.52
- 冷門技術問題(關鍵字提取):$0.41
- 網站改造成賽博朋克風格(僅改 5 檔案):$14.98
- 代碼轉文字再還原(第一步 $0.88,第二步 $5.41)
- 電商系統完整開發:(花費未明確列出,但是 Opus 5 完美實現)
- Android 拖拽排序(禁用第三方庫):(花費未明確列出)
- 歷史事件時間線
- 2026 年 4 月:Claude 推出「玻璃翅膀」計畫,推出 Messos 5(自稱危險,限量開放給蘋果、微軟等)
- 2026 年 6 月 9 日:官方發布 Fable 5(與 Messos 5 等級相當,性能全方位超越)
- 2026 年 6 月 12 日:美國政府因安全理由要求禁止外國人訪問,Claude 選擇直接下架
- 2026 年 6 月 30 日:重新上架,加入變態級安全限制
- Opus 5:官方文件透露採用 Opus 4.8 的安全檢查手段(變相承認降低標準)
- 模型對比
- Claude 的前期模型(Fable):安全審查強度 = 變態級,經常拒答正常問題
- Opus 5:安全分類器存在,但力度比 Fable 寬鬆,比 GPT 嚴格
- GPT 5.6 Turbo:性能相當,審查寬鬆,價格更便宜
- Opus 4.8 / 4.7:幾乎無安全審查,回答所有問題
- Token 消耗
- Opus 5 vs GPT 5.6:Opus 消耗量多 50%
- 官方宣稱增加 30%,但實際感受更多
- 安全審查機制變化
- 舊版本:模型自我判斷是否回答(易被提示詞工程繞過)
- Opus 5 / Fable 5:引入第三方安全分類器,監視對話內容
- Opus 5 拒答測試:講者用記憶體相關代碼測試,Opus 5 拒答但 GPT 5.6 放行
- 網頁開發對比
- Fable:改 15 個檔案左右
- GLM:改 26 個檔案
- Kimi:改 30 個檔案
- Opus 5:改 5 個檔案(效率最高)
- 電商系統功能實現
- 買家賬戶登入、瀏覽商品、聯繫賣家、下單、支付模擬、追蹤訂單
- 賣家賬戶管理多筆訂單、發貨、查看評價、回覆買家評價
結論
結論“Claude Opus 5 技術上毫無疵疵,但過高的成本、冗長的審查,以及缺乏相比 GPT 的獨特優勢,讓它對開發者而言不具競爭力。”
完整解析
詳細Claude 的故事是一齣自我破壞的悲喜劇。公司最初由從 OpenAI 離職的創始人創辦,標榜「安全模型」為核心賣點。2026 年 4 月推出 Messos 5 時,官方宣稱該模型過於強大可能危害人類,因此僅限受信任企業訪問——這是標準的安全宣傳。但轉折發生在 6 月,當 Fable 5 發布時,它非但功能與 Messos 5 相當,甚至在多項基準上全面超越,這立刻打破了「過度危險需限制」的敘事。美國政府隨之以安全為由要求禁止外國人訪問,Claude 卻選擇了極端做法——直接下架模型,讓全球所有用戶都無法使用。
這個決策反映了公司的手忙腳亂。四天後重新上架時,Claude 施加了業界最嚴厲的安全限制,以至於 Fable 5 幾乎對任何有風險標籤的問題都拒答。其結果是可以預見的:當 OpenAI 推出性能相當但審查寬鬆的 GPT 5.6 Turbo 時,用戶直接遷移到 OpenAI,據聞單日新增活躍用戶就達 300 萬。被逼到角落的 Claude 於是推出 Opus 5,在文件裡隱晦地承認採用「Opus 4.8 的安全檢查手段」——也就是變相降低審查強度,因為持續使用 Fable 級的限制已經沒有客戶了。
在性能測試中,Opus 5 確實表現堅實。在七道題中,它在 Lua 反向工程、APK 簽名驗證、技術問題解答等領域一次到位;網站改造時只修改了 5 個檔案(對比競品的 15-30 個),效率最高;完整電商系統實現包含買賣雙方的訂單、支付、評價、消息等全流程功能;即便是難度極高的 Android 拖拽排序(禁用第三方庫),雖然在滾動邊界處有微小抖動,但整體實現依然堪用,與 GPT 5.6 打成平手。從純性能角度,Opus 5 已達業界頂流。
但成本問題隨之浮現。此次測評共耗資 $48.5 美元,折合每小時 $20 多美元——超過講者本身的工時費。更深層的問題是,Opus 5 的 Token 消耗量比 GPT 多 50%(官方宣稱 30%),而價格本身已比 GPT 高,綜合成本差距高達一倍以上。同時,儘管 Opus 5 的安全審查已鬆動,但第三方分類器仍在監視,在記憶體、互可等敏感領域會拒答——這種折中既沒有 GPT 的寬鬆便利,也沒有 Fable 當初承諾的「安全優勢」,只是多了一層不快感。對開發者而言,選擇一個貴 50% 又審查更多的方案,只能在有獨特優勢時才合理;但在講者的體驗中,Opus 5 並未展現出優於 GPT 5.6 Turbo 的特色能力。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


