Sonnet 5 has a major problem nobody's talking about
三句話摘要
Claude Sonnet 5 發布評測:性能接近 Opus 4.8,但定價反而更貴,首次出現故意削弱的功能限制。 Sonnet 5 單次生成能力強勁但成本效益不佳,網路安全功能被故意削弱,現階段應繼續依賴 Opus 4.8 作為主要工作流工具。 性能與價格失衡:雖然 Sonnet 5 在 Frontier Code 基準測試中超越 Opus 4.8,但整體能力約在 Opus 4.7 水準。關鍵問題在於正式價格($3 輸入/$15 輸出 per 百萬 token)高於 Opus 4.8,而 Opus 4.8 在高難度設置下反而成本更低且性能相當或更優。這是 Anthropic 首次推出折扣引導價(至 8 月 31 日為 $2/$10),暗示公司對定價策略的調整。
重點整理
重點- 1
性能與價格失衡:雖然 Sonnet 5 在 Frontier Code 基準測試中超越 Opus 4.8,但整體能力約在 Opus 4.7 水準。關鍵問題在於正式價格($3 輸入/$15 輸出 per 百萬 token)高於 Opus 4.8,而 Opus 4.8 在高難度設置下反而成本更低且性能相當或更優。這是 Anthropic 首次推出折扣引導價(至 8 月 31 日為 $2/$10),暗示公司對定價策略的調整。
- 2
故意功能削弱以規避監管:Sonnet 5 未經網路安全任務訓練,在評估危險網路技能(如開發軟體漏洞利用)時表現遠低於 Opus 4.8 和 Mythus 5,這是為了避免觸發政府審查。模型預設啟用網路安全防護,可能導致大量拒絕回應,類似早期 Fable 5 的問題。
- 3
單次生成能力突出:在無需 Claude Code 工具鏈的情況下,Sonnet 5 能高質量一次生成網頁設計(無 AI 生成感)、實時 3D 地球定位追踪器(單一 HTML 文件含 API 整合)、互動式 WebGL 藝術場景(支援日夜切換、部分隱藏、自動旋轉),前代模型無法實現。
實用技巧與重點
乾貨- 價格(正式):輸入 $3/百萬 token,輸出 $15/百萬 token(9 月 1 日起)
- 價格(折扣期):輸入 $2/百萬 token,輸出 $10/百萬 token(至 8 月 31 日)
- 可用平台:Claude.ai(支援 low/medium/high/max 難度,無 ultra code),Claude Code(支援 ultra code)
- 相對性能:vs Sonnet 4.6 大幅提升;vs Opus 4.8 約為 Opus 4.7 水準
- 基準測試:Frontier Code(Cognition)超越 Opus 4.8;Computer Use 與 Opus 4.8 相近
- 網路安全:故意削弱的 cyber skills 評分遠低於 Opus 4.8 和 Mythus 5;預設啟用網路安全防護
- 測試案例:網頁設計、實時 3D 地球追踪器(含精確位置資料拉取)、WebGL 藝術場景(支援日夜模式、控制元素顯隱、自動旋轉)
結論
結論“Sonnet 5 單次生成能力強勁但成本效益不佳,網路安全功能被故意削弱,現階段應繼續依賴 Opus 4.8 作為主要工作流工具。”
完整解析
詳細Anthropic 最新發布的 Claude Sonnet 5 在基準測試中確實相對前代 Sonnet 4.6 取得顯著進步。然而,這次發布呈現出一個值得注意的悖論:雖然官方宣稱性能接近 Opus 4.8,實際綜合能力約等於 Opus 4.7 級別,更重要的是定價策略似乎未能體現其性能進度。
價格上暴露了問題所在。Sonnet 5 的正式價格為輸入 $3、輸出 $15 per 百萬 token,遠高於同級表現的成本。相比之下,使用 Opus 4.8 的高難度設置(high effort)實際上能以更低的總成本獲得相似甚至更優的性能。這是 Anthropic 有史以來首次為新模型推出介紹性折扣價(至 8 月 31 日降至 $2/$10),這一舉措隱含著對定價結構的反思。在 Frontier Code 與 Computer Use 等第三方基準中,Sonnet 5 與 Opus 4.8 表現相當,但成本考量下,Opus 4.8 仍是更優選擇。該模型並未展現出 Anthropic 所承諾的成本效率優勢。
更引人深思的是 Sonnet 5 在網路安全能力上的故意削弱。這個設計選擇很可能源於監管考量——Sonnet 5 刻意未經網路安全任務訓練,在評估危險網路技能(如開發軟體漏洞利用)時,表現明顯低於 Opus 4.8 和 Mythus 5 級別的模型。為了配合這一限制,Anthropic 預設啟用了網路安全防護機制,可能導致模型對安全相關請求大幅增加拒絕。類似的現象曾在早期 Fable 5 中出現過。
然而,Sonnet 5 的真正優勢在於其單次生成複雜應用的能力。在 Claude.ai 高難度設置下的測試中,該模型無需依賴 Claude Code 工具鏈,即能單次生成設計精良的網頁(避免了常見的「AI 生成感」)、創建包含實時 API 數據的交互式 3D 地球定位追踪器(完全自包含於單一 HTML 文件中)、以及支援日夜模式與互動元素的 WebGL 藝術場景。這些任務在前代模型中基本無法勝任。因此,儘管成本效率存疑,Sonnet 5 作為設計與編碼工具的能力確實值得關注。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


