KeyFrame內部研究專用

Claude Sonnet 5真便宜吗?我按任务成本重新算了一遍

Why QQ·7月1日週三·7 min中文

三句話摘要

Claude Sonnet 5看似降价划算,实际隐蔽成本结构复杂,需要工程师自建成本评估框架而非盲信官方营销。 别看标价多少,要按完整的业务任务重新算账——这是AI工程时代的新常态。 官方数据与实际成本脱节:官方主打"代理能力"提升与价格优惠,却在迁移指南中隐埋分词器变化导致的Token增加。这造成开发者对真实成本的误判,需要逐项核对系统卡片与基准测试数据才能看清。

重點整理

重點
  • 1

    官方数据与实际成本脱节:官方主打"代理能力"提升与价格优惠,却在迁移指南中隐埋分词器变化导致的Token增加。这造成开发者对真实成本的误判,需要逐项核对系统卡片与基准测试数据才能看清。

  • 2

    隐蔽的Token消耗倍增:Sonnet 5通过多轮推理(agentic turns约3倍)来提升代理能力,而非一次性得出最优解。Max Effort模式相比Sonnet 4.6输出Token多40%,在知识工作评估中轮次可达3倍,这是硬成本而非优惠价格能掩盖的事实。

  • 3

    模型定位尴尬且难以选择:既不是最便宜(Hackr更便宜),不是最强(Opus 4.8更强),也不总是最划算(某些场景GLM 5.2更优)。社区反应分裂反映了真实困境:medium effort不够就该直接选Opus 4.8,而非用high effort的Sonnet 5。

  • 4

    成本复杂度上升是AI发展的物理现实:能力提升不再廉价线性,更复杂的推理与代理操作必然消耗更多算力。这不是阴谋而是工程现实,意味着单纯比较$/token已无意义,需要按业务任务重算综合成本。

實用技巧與重點

乾貨
  • 官方推荐价格:输入$2/百万tokens、输出$10/百万tokens(仅至2026年8月31日);9月1日后恢复至$3和$15
  • Sonnet 5性能数据:Intelligence Index比Sonnet 4.6高6分,在代理知识工作任务上超过Opus 4.8
  • Token消耗增加
  • Max Effort模式vs Sonnet 4.6:输出Token增加约40%
  • Agentic turns:约3倍
  • GDPVALAA评估:Max Effort约为Low Effort的6倍
  • 分词器成本影响(新tokenizer导致):
  • 英文:增加42%(1.42倍)
  • 西班牙文:增加33%(1.33倍)
  • Python代码:增加27%(1.27倍)
  • 中文:基本无变化(1.01倍)
  • 综合成本对比(标准价格$3/$15下):
  • Sonnet 5平均每任务:$2.29
  • Opus 4.8:$1.99
  • Sonnet 5贵约15%
  • 社区共识:Medium effort不够则应选Opus 4.8,不要升高Sonnet 5的effort档位
  • 对标产品:GLM 5.2在成本和开源权重维度有优势

結論

結論

别看标价多少,要按完整的业务任务重新算账——这是AI工程时代的新常态。

完整解析

詳細

Anthropic在2026年6月30日(美国时间)/ 7月1日(北京时间)发布了Claude Sonnet 5,官方通稿主打"代理能力"(Agentic)这一核心卖点。然而,当讲者深入阅读官方的系统卡片、迁移指南和第三方评测机构Artificial Analysis的详细数据后,发现社区对这款模型的反应远不如官方声明那般乐观——有开发者直言不如继续用Opus 4.8,也有人认为在低中档位努力下仍有日常工作流价值。

问题的关键在于成本结构的隐蔽性。官方确实通过Artificial Analysis的测试展示了Sonnet 5的进步:Intelligence Index比Sonnet 4.6高6分,甚至在代理知识工作任务上超越了更贵的Opus 4.8。为了吸引开发者迁移,官方还推出了限时优惠价格——输入token仅需$2/百万,输出token $10/百万,价格确实诱人。但这只是故事的前半部分。

后半部分才是真实的成本账本。Sonnet 5的代理能力提升并非魔法,而是通过让模型进行多轮推理来实现。根据Artificial Analysis的测试,Sonnet 5在Max Effort模式下相比Sonnet 4.6的输出token增加约40%;在AA Briefcase和GDPVALAA等知识工作评估中,代理轮次(agentic turns)约为3倍;在GDPVALAA上Max Effort约为Low Effort的6倍。换句话说,模型不是一次性想出最优解,而是反复尝试、反复调用工具——就像餐厅的厨师先尝一口菜再加盐,再尝再加油,最后菜做好了但账单翻了倍数。

更容易被忽略的是分词器的变化。Sonnet 5使用了新的tokenizer(Anthropic在Opus 4.7时引入),官方文档明确指出:同样的文本在Sonnet 5上约多30% Token。但很多开发者在看发布通稿时没有翻到迁移指南。根据实测数据,这个增加在不同语言上的影响各不相同——英文文本增加42%,西班牙文33%,Python代码27%,而中文基本无变化。这意味着用英文写的Prompt现在要多付42%的钱,代码注释要多付27%。而且这部分成本影响会一直存在,不受推荐价格失效的限制。

当把所有成本因素综合计算后,用标准价格($3输入/$15输出)对比,Sonnet 5平均每个Intelligence Index任务的成本约为$2.29,而Opus 4.8仅需$1.99。Sonnet 5总体贵约15%。这个数据揭示了问题的本质:如果你觉得Sonnet 5的low effort模式不够好,正确做法不是升高effort档位,而是直接换用Opus 4.8的default effort,反而更便宜。Hacker News和Reddit的讨论中,技术社区已形成共识:medium effort不够就换Opus 4.8,不要执意提升Sonnet 5的effort。

Sonnet 5的定位因此变得尴尬——它既不是最便宜(Hackr等更便宜),也不是最强(Opus 4.8更强),更不总是最划算(在某些场景GLM 5.2更优)。很多开发者怀疑Anthropic在玩定价游戏,用推荐价格和新分词器来隐蔽涨价。但讲者认为真相是大模型发展触碰了一堵无形的墙:能力提升不再是线性且廉价的。要让模型做更复杂的推理、处理更长的上下文关联、执行更多的代理操作,它就必须消耗更多算力。Sonnet 5的代理能力提升本质上是通过多思考几步来实现,这个思考过程体现在token消耗上,这是工程的物理现实,而非厂商的阴谋。

面对这样的复杂局面,讲者给出了四点建议:第一,基于自己的工作负载做基准测试,用Sonnet 5、Opus 4.8、GLM 5.2分别跑典型任务并记录成本;第二,考虑长期成本而非短期促销,推荐价格只到8月31日但分词器成本永久存在;第三,根据任务复杂度选择——简单任务用Haiku,中等复杂用Sonnet 5的low effort,复杂推理用Opus 4.8;第四,关注开源替代品如GLM 5.2在成本和开放权重上的优势。这本质上是在AI时代建立微服务架构式的模型选择策略。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。