KeyFrame內部研究專用

【Opus 5实战测评】性能超强!价格超高!

紫孔雀科技·7月26日週日·29 min中文

三句話摘要

評測 Claude Opus 5 模型的性能表現、成本效益,以及對其公司歷史決策的批評。 Claude Opus 5 技術上毫無疵疵,但過高的成本、冗長的審查,以及缺乏相比 GPT 的獨特優勢,讓它對開發者而言不具競爭力。 Claude 的歷史決策形成惡性循環。公司創立時以「安全」為賣點,後來推出強大的 Messos 5 卻因政府安全顧慮下架,再加上變態級的安全限制,導致用戶逃往 GPT。Opus 5 是公司被迫降低審查強度的妥協產物,因為如果繼續採用 Fable 那種審查力度已經沒有客戶了。

重點整理

重點
  • 1

    Claude 的歷史決策形成惡性循環。公司創立時以「安全」為賣點,後來推出強大的 Messos 5 卻因政府安全顧慮下架,再加上變態級的安全限制,導致用戶逃往 GPT。Opus 5 是公司被迫降低審查強度的妥協產物,因為如果繼續採用 Fable 那種審查力度已經沒有客戶了。

  • 2

    Opus 5 的技術能力確實紮實,單次題目多數一次到位或修改次數少(如 APK 簽名題改兩次通過、網站只改 5 個檔案),但整體 Token 消耗量比 GPT 多 50%,加上原本就比 GPT 價格高,導致使用成本遠高於競品。

  • 3

    安全審查實施方式改變了。Opus 5 與 Fable 5 都引入了第三方安全分類器(用另一個模型監視對話),相比舊版本的自我判斷更難被提示詞工程繞過;但 Opus 5 的分類器強度沒有 Fable 那麼極端,只在涉及記憶體或互可等特別敏感領域拒答,正常開發問題通常放行。

  • 4

    講者認為沒有選擇理由。同等性能下,為何花更多錢用一個審查更多的服務,而不選審查更少又更便宜的 GPT 5.6 Turbo?除非有特殊優勢,否則 Opus 5 對他這類開發者而言是劣選。

實用技巧與重點

乾貨
  • 測評環境與成本
  • 平台:OpenRouter
  • API 格式:OpenAI 相容
  • 推理強度:最高
  • Token 上限:100 萬
  • 總花費:$48.5 美元
  • 測評時長:約 10 小時,成本超過 $200 美元
  • 7 道測試題與費用
  • Lua 代碼反向:$2.16
  • APK 簽名驗證(修改 2 次通過):$1.52
  • 冷門技術問題(關鍵字提取):$0.41
  • 網站改造成賽博朋克風格(僅改 5 檔案):$14.98
  • 代碼轉文字再還原(第一步 $0.88,第二步 $5.41)
  • 電商系統完整開發:(花費未明確列出,但是 Opus 5 完美實現)
  • Android 拖拽排序(禁用第三方庫):(花費未明確列出)
  • 歷史事件時間線
  • 2026 年 4 月:Claude 推出「玻璃翅膀」計畫,推出 Messos 5(自稱危險,限量開放給蘋果、微軟等)
  • 2026 年 6 月 9 日:官方發布 Fable 5(與 Messos 5 等級相當,性能全方位超越)
  • 2026 年 6 月 12 日:美國政府因安全理由要求禁止外國人訪問,Claude 選擇直接下架
  • 2026 年 6 月 30 日:重新上架,加入變態級安全限制
  • Opus 5:官方文件透露採用 Opus 4.8 的安全檢查手段(變相承認降低標準)
  • 模型對比
  • Claude 的前期模型(Fable):安全審查強度 = 變態級,經常拒答正常問題
  • Opus 5:安全分類器存在,但力度比 Fable 寬鬆,比 GPT 嚴格
  • GPT 5.6 Turbo:性能相當,審查寬鬆,價格更便宜
  • Opus 4.8 / 4.7:幾乎無安全審查,回答所有問題
  • Token 消耗
  • Opus 5 vs GPT 5.6:Opus 消耗量多 50%
  • 官方宣稱增加 30%,但實際感受更多
  • 安全審查機制變化
  • 舊版本:模型自我判斷是否回答(易被提示詞工程繞過)
  • Opus 5 / Fable 5:引入第三方安全分類器,監視對話內容
  • Opus 5 拒答測試:講者用記憶體相關代碼測試,Opus 5 拒答但 GPT 5.6 放行
  • 網頁開發對比
  • Fable:改 15 個檔案左右
  • GLM:改 26 個檔案
  • Kimi:改 30 個檔案
  • Opus 5:改 5 個檔案(效率最高)
  • 電商系統功能實現
  • 買家賬戶登入、瀏覽商品、聯繫賣家、下單、支付模擬、追蹤訂單
  • 賣家賬戶管理多筆訂單、發貨、查看評價、回覆買家評價

結論

結論

Claude Opus 5 技術上毫無疵疵,但過高的成本、冗長的審查,以及缺乏相比 GPT 的獨特優勢,讓它對開發者而言不具競爭力。

完整解析

詳細

Claude 的故事是一齣自我破壞的悲喜劇。公司最初由從 OpenAI 離職的創始人創辦,標榜「安全模型」為核心賣點。2026 年 4 月推出 Messos 5 時,官方宣稱該模型過於強大可能危害人類,因此僅限受信任企業訪問——這是標準的安全宣傳。但轉折發生在 6 月,當 Fable 5 發布時,它非但功能與 Messos 5 相當,甚至在多項基準上全面超越,這立刻打破了「過度危險需限制」的敘事。美國政府隨之以安全為由要求禁止外國人訪問,Claude 卻選擇了極端做法——直接下架模型,讓全球所有用戶都無法使用。

這個決策反映了公司的手忙腳亂。四天後重新上架時,Claude 施加了業界最嚴厲的安全限制,以至於 Fable 5 幾乎對任何有風險標籤的問題都拒答。其結果是可以預見的:當 OpenAI 推出性能相當但審查寬鬆的 GPT 5.6 Turbo 時,用戶直接遷移到 OpenAI,據聞單日新增活躍用戶就達 300 萬。被逼到角落的 Claude 於是推出 Opus 5,在文件裡隱晦地承認採用「Opus 4.8 的安全檢查手段」——也就是變相降低審查強度,因為持續使用 Fable 級的限制已經沒有客戶了。

在性能測試中,Opus 5 確實表現堅實。在七道題中,它在 Lua 反向工程、APK 簽名驗證、技術問題解答等領域一次到位;網站改造時只修改了 5 個檔案(對比競品的 15-30 個),效率最高;完整電商系統實現包含買賣雙方的訂單、支付、評價、消息等全流程功能;即便是難度極高的 Android 拖拽排序(禁用第三方庫),雖然在滾動邊界處有微小抖動,但整體實現依然堪用,與 GPT 5.6 打成平手。從純性能角度,Opus 5 已達業界頂流。

但成本問題隨之浮現。此次測評共耗資 $48.5 美元,折合每小時 $20 多美元——超過講者本身的工時費。更深層的問題是,Opus 5 的 Token 消耗量比 GPT 多 50%(官方宣稱 30%),而價格本身已比 GPT 高,綜合成本差距高達一倍以上。同時,儘管 Opus 5 的安全審查已鬆動,但第三方分類器仍在監視,在記憶體、互可等敏感領域會拒答——這種折中既沒有 GPT 的寬鬆便利,也沒有 Fable 當初承諾的「安全優勢」,只是多了一層不快感。對開發者而言,選擇一個貴 50% 又審查更多的方案,只能在有獨特優勢時才合理;但在講者的體驗中,Opus 5 並未展現出優於 GPT 5.6 Turbo 的特色能力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。