Anthropic 推出 Opus 4.7,Claude Code 降智危機解了嗎?
三句話摘要
Claude 過去兩週降智的根本原因是 Anthropic 算力不足,新發布的 Opus 4.7 如何應對這場危機。 當 AI 不再是完美助手時,你的提示詞工程能力才是決定輸出品質的真正分水嶺。 算力危機驅動的被動降智 — Anthropic 年營收近 300 億美金,成長速度超越 OpenAI,但 GPU 投資只有 OpenAI 的四分之一,導致用戶激增無法支撐。該公司透過降低預設思考深度、縮減輸出 token、限流尖峰時段等手段堆砌,讓模型看起來變笨,實際上是算力分配的結果。AMD 工程師分析顯示推理深度砍 73%、不讀檔直接改程式碼的比例從 6% 飆到 33.7%。
重點整理
重點- 1
算力危機驅動的被動降智 — Anthropic 年營收近 300 億美金,成長速度超越 OpenAI,但 GPU 投資只有 OpenAI 的四分之一,導致用戶激增無法支撐。該公司透過降低預設思考深度、縮減輸出 token、限流尖峰時段等手段堆砌,讓模型看起來變笨,實際上是算力分配的結果。AMD 工程師分析顯示推理深度砍 73%、不讀檔直接改程式碼的比例從 6% 飆到 33.7%。
- 2
Opus 4.7 多面向的實質升級 — 視覺解析度翻三倍(2576 像素),安全公司實測視覺敏銳度從 54.5% 直接跳到 98.5%;新增 xhigh 努力級別填補 high 和 max 之間的 gap;ultrareview 提供獨立程式碼審查視角;跨 session 檔案記憶系統更成熟。官方定價未漲,但新 tokenizer 讓相同輸入消耗多 35% token。
- 3
指令字面化的雙面效應 — 4.7 「takes instructions literally」,逐字遵從提示詞而不自作聰明,降低幻覺和無謂延伸,但也失去了前代「會補位」的機靈感。這反過來逼迫使用者回到提示詞工程的基本功,寫清楚意圖、組織好工作流、正確擺放 context。
- 4
Benchmark vs 實際體感的落差 — Coding benchmark 提升 13%、CursorBench 跳 12 個百分點、Rakuten 任務成功率三倍、文件推理從 57 拉到 80 分,但一小時的日常工作流體驗無明顯差異。Benchmark 測上限能力(完美考試),日常工作流測平均表現(100 次任務中有多少次不出錯),兩者維度不同。
實用技巧與重點
乾貨- Anthropic 的成長與危機數據
- 年化營收 (ARR):300 億美金(本月剛超越 OpenAI 的 240 億)
- 成長速度:15 個月 30 倍成長,90 億→300 億只花 4 個月
- 企業大戶:年付 100 萬美金以上客戶從 2 月到現在翻倍,超過 1,000 家
- 硬體投資:Anthropic 訓練支出約 OpenAI 的四分之一
- GPU 限制:3 月底開始美東早上 8 點→下午 2 點限流,4 月 4 號企業方案改 pay-as-you-go
- 降智的量化證據(AMD 工程師分析 7,000 次對話)
- 推理深度:平均推理字元從 2,200 掉到 600,下降 73%
- 不讀檔直接改程式碼:6% → 33.7%(每三次互動一次沒看程式碼就改)
- 模型停頓要打斷頻率:增加 12 倍
- 「simplest」出現頻率:增加近 3 倍
- Opus 4.7 新功能
- 視覺解析度:長邊上限 2,576 像素(≈375 萬像素)
- 努力級別:新增 xhigh(介於 high 和 max 之間)
- 代碼審查:新增 ultrareview 指令,3 次免費額度(不計入訂閱額度)
- Auto mode:Max 方案現已可用,自動選擇努力級別
- Task budgets:API public beta,直接設 token 預算上限
- Benchmark 成績
- 官方 coding benchmark:93 題,4.7 vs 4.6 提升 13%
- CursorBench(IDE 場景):4.7 為 70%,4.6 為 58%
- Rakuten SWE 測試:4.7 能解決的生產環境任務數是 4.6 的三倍,程式碼品質和測試品質雙位數成長
- GDP val(綜合能力排行):4.7 拿 1753 分,超越 GPT 5.4 的 1674,遠超 4.6 的 1619
- Document and reasoning:4.6 為 57.1,4.7 為 80.6;對比 Gemini 3.1 的 42 分、GPT 5.4 的 51 分
- Tokenizer 和定價變化
- 新 tokenizer:相同輸入消耗 1~1.35 倍 token
- API 定價:輸入 500 萬 token,輸出 2500 萬 token(與 4.6 相同)
- 帳單影響:單價不漲但用量增加 35%,整體成本高機率增加
- 使用者體驗反饋
- Hex 技術長評語:「Low-effort Opus 4.7 roughly equivalent to medium-effort Opus 4.6」
- 指令跟隨:4.7「takes instructions literally」,一字一句照做,不自動腦補意圖
結論
結論“當 AI 不再是完美助手時,你的提示詞工程能力才是決定輸出品質的真正分水嶺。”
完整解析
詳細Anthropic 在過去兩週面臨了一場無聲的危機。作為曾經被重度使用者寄予厚望的「天才少年」,Claude 突然變得思維淺薄、動輒亂改程式碼、甚至回覆看不懂的語言。這不是個人的錯覺——AMD 工程師用 7000 次真實對話數據驗證了這個現象的普遍性:推理深度砍掉 73%、無視檔案直接修改的比例從 6% 飆到 33.7%。
根本原因指向同一個方向:算力危機。Anthropic 的成長速度已經追上甚至超越 OpenAI,年營收剛破 300 億美金,15 個月成長 30 倍。但硬體投資沒有跟上——根據華爾街日報的財務預測,Anthropic 的訓練支出只有 OpenAI 的四分之一。這形成了一個窘境:企業大戶翻倍(年付 100 萬美金以上客戶超過 1000 家),但 GPU 根本撐不住。官方的應對方案是悄無聲息地降低模型的運算預算——減少預設思考深度、限流尖峰時段(美東早上 8 點到下午 2 點)、改 pay-as-you-go 計費、甚至把 token 額度變相縮水。模型沒有變笨,只是被戴上了手銬。
昨天 Opus 4.7 的發布,對使用者來說是一份期待已久的考卷。新版本推出了幾項實質改進:視覺解析度翻了三倍(從標準解析度升到 2576 像素),讓 AI 能清楚識別截圖中的小字、複雜架構圖,安全公司的實測顯示視覺敏銳度從 54.5% 直接跳到 98.5%;新增 xhigh 努力級別填補 high 和 max 之間的灰色地帶;ultrareview 指令提供獨立的代碼審查視角;跨 session 的檔案記憶系統更成熟,讓長期專案不必每次重複交代背景。Benchmark 成績好看——coding 提升 13%、document and reasoning 從 57 拉到 80、Rakuten 企業測試顯示能解決的生產任務三倍成長。但一小時的實際工作流體驗卻「很無感」。
這個反差指向一個重要區別:Benchmark 測的是模型的上限能力,像考試拿滿分;日常工作流測的是平均表現,關鍵是 100 次任務中有多少次能不出錯。新版還有兩個隱藏成本:新的 tokenizer 讓相同輸入消耗多 35% token,帳單會變貴;4.7「takes instructions literally」,逐字遵從提示詞而不自作聰明,失去了前代那種「會補位、會給你驚喜」的機靈感。這反而把球踢回了使用者——你必須寫得更清楚、更精確的提示詞。
講者的建議很實際:與其被情緒綁架,不如把能力收回自己手上。過去一年模型可能把使用者寵壞了,輸出強、容錯高,隨便丟模糊需求進去都有說得過去的答案。這波危機其實在逼著所有人正視一件事——AI 的輸出品質不只是模型的事,關鍵在互動過程中有沒有把意圖定義清楚。趁這個機會,好好練習梳理思緒、寫清楚提示詞、組織好工作流、擺對 context。這些是永遠的基本功。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


