KeyFrame內部研究專用

Anthropic 推出 Opus 4.7,Claude Code 降智危機解了嗎?

Gary Chen·4月17日週五·13 min中文

三句話摘要

Claude 過去兩週降智的根本原因是 Anthropic 算力不足,新發布的 Opus 4.7 如何應對這場危機。 當 AI 不再是完美助手時,你的提示詞工程能力才是決定輸出品質的真正分水嶺。 算力危機驅動的被動降智 — Anthropic 年營收近 300 億美金,成長速度超越 OpenAI,但 GPU 投資只有 OpenAI 的四分之一,導致用戶激增無法支撐。該公司透過降低預設思考深度、縮減輸出 token、限流尖峰時段等手段堆砌,讓模型看起來變笨,實際上是算力分配的結果。AMD 工程師分析顯示推理深度砍 73%、不讀檔直接改程式碼的比例從 6% 飆到 33.7%。

重點整理

重點
  • 1

    算力危機驅動的被動降智 — Anthropic 年營收近 300 億美金,成長速度超越 OpenAI,但 GPU 投資只有 OpenAI 的四分之一,導致用戶激增無法支撐。該公司透過降低預設思考深度、縮減輸出 token、限流尖峰時段等手段堆砌,讓模型看起來變笨,實際上是算力分配的結果。AMD 工程師分析顯示推理深度砍 73%、不讀檔直接改程式碼的比例從 6% 飆到 33.7%。

  • 2

    Opus 4.7 多面向的實質升級 — 視覺解析度翻三倍(2576 像素),安全公司實測視覺敏銳度從 54.5% 直接跳到 98.5%;新增 xhigh 努力級別填補 high 和 max 之間的 gap;ultrareview 提供獨立程式碼審查視角;跨 session 檔案記憶系統更成熟。官方定價未漲,但新 tokenizer 讓相同輸入消耗多 35% token。

  • 3

    指令字面化的雙面效應 — 4.7 「takes instructions literally」,逐字遵從提示詞而不自作聰明,降低幻覺和無謂延伸,但也失去了前代「會補位」的機靈感。這反過來逼迫使用者回到提示詞工程的基本功,寫清楚意圖、組織好工作流、正確擺放 context。

  • 4

    Benchmark vs 實際體感的落差 — Coding benchmark 提升 13%、CursorBench 跳 12 個百分點、Rakuten 任務成功率三倍、文件推理從 57 拉到 80 分,但一小時的日常工作流體驗無明顯差異。Benchmark 測上限能力(完美考試),日常工作流測平均表現(100 次任務中有多少次不出錯),兩者維度不同。

實用技巧與重點

乾貨
  • Anthropic 的成長與危機數據
  • 年化營收 (ARR):300 億美金(本月剛超越 OpenAI 的 240 億)
  • 成長速度:15 個月 30 倍成長,90 億→300 億只花 4 個月
  • 企業大戶:年付 100 萬美金以上客戶從 2 月到現在翻倍,超過 1,000 家
  • 硬體投資:Anthropic 訓練支出約 OpenAI 的四分之一
  • GPU 限制:3 月底開始美東早上 8 點→下午 2 點限流,4 月 4 號企業方案改 pay-as-you-go
  • 降智的量化證據(AMD 工程師分析 7,000 次對話)
  • 推理深度:平均推理字元從 2,200 掉到 600,下降 73%
  • 不讀檔直接改程式碼:6% → 33.7%(每三次互動一次沒看程式碼就改)
  • 模型停頓要打斷頻率:增加 12 倍
  • 「simplest」出現頻率:增加近 3 倍
  • Opus 4.7 新功能
  • 視覺解析度:長邊上限 2,576 像素(≈375 萬像素)
  • 努力級別:新增 xhigh(介於 high 和 max 之間)
  • 代碼審查:新增 ultrareview 指令,3 次免費額度(不計入訂閱額度)
  • Auto mode:Max 方案現已可用,自動選擇努力級別
  • Task budgets:API public beta,直接設 token 預算上限
  • Benchmark 成績
  • 官方 coding benchmark:93 題,4.7 vs 4.6 提升 13%
  • CursorBench(IDE 場景):4.7 為 70%,4.6 為 58%
  • Rakuten SWE 測試:4.7 能解決的生產環境任務數是 4.6 的三倍,程式碼品質和測試品質雙位數成長
  • GDP val(綜合能力排行):4.7 拿 1753 分,超越 GPT 5.4 的 1674,遠超 4.6 的 1619
  • Document and reasoning:4.6 為 57.1,4.7 為 80.6;對比 Gemini 3.1 的 42 分、GPT 5.4 的 51 分
  • Tokenizer 和定價變化
  • 新 tokenizer:相同輸入消耗 1~1.35 倍 token
  • API 定價:輸入 500 萬 token,輸出 2500 萬 token(與 4.6 相同)
  • 帳單影響:單價不漲但用量增加 35%,整體成本高機率增加
  • 使用者體驗反饋
  • Hex 技術長評語:「Low-effort Opus 4.7 roughly equivalent to medium-effort Opus 4.6」
  • 指令跟隨:4.7「takes instructions literally」,一字一句照做,不自動腦補意圖

結論

結論

當 AI 不再是完美助手時,你的提示詞工程能力才是決定輸出品質的真正分水嶺。

完整解析

詳細

Anthropic 在過去兩週面臨了一場無聲的危機。作為曾經被重度使用者寄予厚望的「天才少年」,Claude 突然變得思維淺薄、動輒亂改程式碼、甚至回覆看不懂的語言。這不是個人的錯覺——AMD 工程師用 7000 次真實對話數據驗證了這個現象的普遍性:推理深度砍掉 73%、無視檔案直接修改的比例從 6% 飆到 33.7%。

根本原因指向同一個方向:算力危機。Anthropic 的成長速度已經追上甚至超越 OpenAI,年營收剛破 300 億美金,15 個月成長 30 倍。但硬體投資沒有跟上——根據華爾街日報的財務預測,Anthropic 的訓練支出只有 OpenAI 的四分之一。這形成了一個窘境:企業大戶翻倍(年付 100 萬美金以上客戶超過 1000 家),但 GPU 根本撐不住。官方的應對方案是悄無聲息地降低模型的運算預算——減少預設思考深度、限流尖峰時段(美東早上 8 點到下午 2 點)、改 pay-as-you-go 計費、甚至把 token 額度變相縮水。模型沒有變笨,只是被戴上了手銬。

昨天 Opus 4.7 的發布,對使用者來說是一份期待已久的考卷。新版本推出了幾項實質改進:視覺解析度翻了三倍(從標準解析度升到 2576 像素),讓 AI 能清楚識別截圖中的小字、複雜架構圖,安全公司的實測顯示視覺敏銳度從 54.5% 直接跳到 98.5%;新增 xhigh 努力級別填補 high 和 max 之間的灰色地帶;ultrareview 指令提供獨立的代碼審查視角;跨 session 的檔案記憶系統更成熟,讓長期專案不必每次重複交代背景。Benchmark 成績好看——coding 提升 13%、document and reasoning 從 57 拉到 80、Rakuten 企業測試顯示能解決的生產任務三倍成長。但一小時的實際工作流體驗卻「很無感」。

這個反差指向一個重要區別:Benchmark 測的是模型的上限能力,像考試拿滿分;日常工作流測的是平均表現,關鍵是 100 次任務中有多少次能不出錯。新版還有兩個隱藏成本:新的 tokenizer 讓相同輸入消耗多 35% token,帳單會變貴;4.7「takes instructions literally」,逐字遵從提示詞而不自作聰明,失去了前代那種「會補位、會給你驚喜」的機靈感。這反而把球踢回了使用者——你必須寫得更清楚、更精確的提示詞。

講者的建議很實際:與其被情緒綁架,不如把能力收回自己手上。過去一年模型可能把使用者寵壞了,輸出強、容錯高,隨便丟模糊需求進去都有說得過去的答案。這波危機其實在逼著所有人正視一件事——AI 的輸出品質不只是模型的事,關鍵在互動過程中有沒有把意圖定義清楚。趁這個機會,好好練習梳理思緒、寫清楚提示詞、組織好工作流、擺對 context。這些是永遠的基本功。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。