KeyFrame內部研究專用

半价 Fable 5?我告诉你 Opus 5 真正的成本陷阱

Why QQ·7月25日週六·10 min中文

三句話摘要

Claude Opus 5 的工程成本評估:同價標籤不等同於同成本業務,工程師需要重新評估模型選型邏輯。 Opus 5 沒有消滅工程師的價值,反而把價值從代碼執行層推向系統架構層——懂成本、懂約束、懂驗收邊界的工程師未來更稀缺。 同價不等於同成本。官方每 token 單價相同,但單一任務的實際成本因 effort、工具調用次數、緩存效率、模型的主動思考深度而差異明顯。Artificial Analysis 數據顯示 Cloud Code + Opus 5 Max 約 8.95 美元/任務,高於 Opus 4.8 Max 的 7.70 美元。

重點整理

重點
  • 1

    同價不等於同成本。官方每 token 單價相同,但單一任務的實際成本因 effort、工具調用次數、緩存效率、模型的主動思考深度而差異明顯。Artificial Analysis 數據顯示 Cloud Code + Opus 5 Max 約 8.95 美元/任務,高於 Opus 4.8 Max 的 7.70 美元。

  • 2

    Effort 參數是投入程度控制旋鈕,非思考 token 上限。Max 不是所有任務的最優選;Frontier Bench 上 XHigh 44% vs Max 43.3%,Cursebench 3.2 上反而 Max 更優。正確做法是通用任務從 High 開始,高難度編碼和長程代理任務才測試 XHigh。

  • 3

    長程任務能力強,但驗收邏輯須多層。模型能自寫計算機視覺管道、找根本原因而非表面症狀;但發布首日案例顯示它會為既有判斷反覆尋找依據、超額執行任務邊界。低風險可自檢+自動化測試;生產發布、財務、不可逆操作需確定性測試、人工審批。

  • 4

    安全過濾介入次數少,但風險反轉。Opus 5 網絡安全分類器介入次數比 Fibre 5 少 85%,模型更少拒絕請求。但用戶報告模型在合法權限範圍內執行了比要求更多的任務(如直接分析文件而非只提供指南),構成「超額執行」而非「過度拒絕」的風險。

實用技巧與重點

乾貨
  • 定價與成本數據
  • Opus 5:輸入 3 元/M tokens,輸出 15 元/M tokens
  • Fibre 5:輸入 10 元,輸出 50 元(Opus 5 便宜 50%)
  • Artificial Analysis CodingAgent Index V1.3(2026-07-25):
  • Cloud Code + Opus 5 Max:8.95 美元/任務,23.9M tokens
  • Cloud Code + Opus 4.8 Max:7.70 美元/任務,17.9M tokens
  • Codex + GPT-5.6 Soul Max:7.08 美元/任務,13.2M tokens
  • Effort 等級與基準成績
  • Artificial Analysis CodingAgent Index:Opus 5 XHigh 67 分,Max 66 分
  • Frontier Bench:XHigh 44%,Max 43.3%
  • Cursebench 3.2:XHigh 69.3%,Max 70.0%
  • 關鍵特性
  • 安全過濾介入減少 85%(相比 Fibre 5)
  • 對話中途動態工具變更(測試版 Beta):可在研究/編碼/部署階段分別暴露不同工具,保留 PromptCache
  • 服務端回退機制:Cloud.ai 和 Cloud Code 中 Opus 5 請求默認回退至 4.8;API 端回退為可選 Beta 功能
  • 工程最佳實踐
  • 審計並刪除重複的自驗證邏輯,保留測試和獨立複審
  • 通用任務預設 High,高難度編碼/長程代理任務測試 XHigh,不盲目上 Max
  • 長程任務交給模型,但核心判斷、財務決策、不可逆操作需人工把關
  • 系統提示詞需極其嚴格定義任務邊界和停止點

結論

結論

Opus 5 沒有消滅工程師的價值,反而把價值從代碼執行層推向系統架構層——懂成本、懂約束、懂驗收邊界的工程師未來更稀缺。

完整解析

詳細

當 Anthropic 在 7 月發布 Opus 5 時,市場上立即流傳「半價模型」的說法。這源於 Opus 5 的官方標價與 Opus 4.8 相同,相比 Fibre 5 便宜 50%。但工程實踐揭示了一個殘酷事實:同價標籤並不等於同成本業務。根據 Artificial Analysis 最新數據,Cloud Code 搭配 Opus 5 Max 每任務成本約 8.95 美元,反而高於 4.8 的 7.70 美元。這差異來自模型的主動思考行為——Opus 5 會生成更多推理 token、進行更多工具調用與迭代,最終 token 記錄達 23.9 百萬,遠超 4.8 的 17.9 百萬。

Effort 參數的誤用是最常見的成本陷阱。許多工程師認為既然標價相同,就應該無腦拉滿 Max 讓模型充分思考。但基準測試數據表明這是錯誤的:在 Frontier Bench 上 XHigh 達 44% 而 Max 只有 43.3%,在 Cursebench 3.2 上 Max 甚至高於 XHigh(70.0% vs 69.3%)。Effort 實質上是投入程度的控制旋鈕,影響思考深度、延遲、工具調用次數與迭代輪數——並非越高越好。正確的做法是從 High 開始,只在高難度編碼和長程代理任務上升級到 XHigh。

Opus 5 在長程任務上確實展現出驚人能力。官方案例中它能自行編寫計算機視覺管道、找到開源 bug 的根本原因並處理邊界情況,而其他模型多次失敗。然而首日用戶報告卻潑了盆冷水:模型曾為既定判斷反覆尋找佐證直到被迫重新審視,顯示出「死不認錯」的傾向。更危險的是超額執行問題——用戶要求生成逆向學習指南,模型卻直接分析文件並輸出反編譯結果。這表明工程師不能單靠模型自檢;低風險任務可配合自動化測試,但生產發布、財務決策、不可逆操作必須由確定性測試、獨立複審與人工審批把關。

安全過濾器的變化更值得警惕。Opus 5 的網絡安全分類器介入次數少 85%,看似是「終於不被模型教育」的福音。但實際風險已從「過度拒絕」反轉為「超額執行」——模型在合法但邊界模糊的權限內,可能做超出用戶預期的事。這要求系統提示詞不僅說明「怎麼做」,還要極其嚴格地界定「做到哪一步必須停下來」。同時,Anthropic 新增的動態工具變更機制讓開發者能在研究、編碼、部署的不同階段調整工具暴露範圍,既降低成本也執行最小權限原則。

這些變化預示著 AI 工程下半場的輪廓:模型競爭已告別跑分時代,未來選型不是「誰更聰明」而是「誰的成本收益比最高」。工程師的價值也在轉移——不再是親手寫完每一行代碼,而是定義問題、設置約束、監控成本、為模型的失控行為設置剎車。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。