DeepSeek这条斩杀线,斩的是谁
三句話摘要
AI 模型定價戰爭與智能體時代的成本革命——從榜單對比到實際成本計算的範式轉移。 ## 從今天起,每一次模型調用都值得過一遍帳——完成任務花多少錢和回答有多聰明是兩件事,把這兩件事混在一起做決策的團隊會持續多付錢。 成本計算方式的轉變:過去選模型只看榜單分數,現在必須計算完成一項實際任務的總成本。智能體不是問一次就結束,而是循環讀文件、改代碼、跑程試、看結果,失敗重試,Token 消耗可以翻幾十倍甚至幾百倍。幾分能力差距影響是否需要多試兩輪,幾十倍的價格差距才決定任務有沒有資格跑起來。
重點整理
重點- 1
成本計算方式的轉變:過去選模型只看榜單分數,現在必須計算完成一項實際任務的總成本。智能體不是問一次就結束,而是循環讀文件、改代碼、跑程試、看結果,失敗重試,Token 消耗可以翻幾十倍甚至幾百倍。幾分能力差距影響是否需要多試兩輪,幾十倍的價格差距才決定任務有沒有資格跑起來。
- 2
成本優化的技術底氣:V4 Flash 的低價不是補貼,而是工程優化的結果。總參數 2840 億但只激活 130 億(配合混合注意力結構)、長上下文緩存優化、後訓練針對編碼與智能體任務、專門設計的工具調用格式。這些都沒增加參數卻讓智能體最常見的失敗一項項修掉了。
- 3
市場實際流向:不只是免費額度燒出來的泡沫。OpenCode 9 天內平台 Token 總量升 3 倍,開發者團隊開始敞開用 AI 後台,把原本一次性提問變成數小時的智能體任務。海外平台 OpenRoute 數據顯示 DeepSeek 成為第一大模型廠商。
- 4
「斬殺線」對中間層的威脅:最弱的小模型本來就便宜、最強的旗艦有不可替代的場景,真正難受的是中間層——比 V4 Flash 強卻貴幾十倍,但又沒強到能穩定解決 Flash 做不了的問題。這層模型只要大多數時候能把活幹完就會被擠出默認調用位。
- 5
##
實用技巧與重點
乾貨- 定價數據(截至 2026 年 8 月)
- DeepSeek V4 Flash:0.28 美元/百萬 Token(輸出);0.0028 美元/百萬 Token(緩存命中輸入)
- Claude Opus 4.8:25 美元/百萬 Token(輸出)
- Claude Sonnet、Gemini:均高出幾倍
- GPT 5.6:輸出價 1.2 美元上下
- Artificial Analysis 評測對比
- V4 Flash:52 分,評測成本 72 美元,生成 2.1 億 Token
- Claude Opus 4.8:57 分,評測成本 3752 美元,生成 1.2 億 Token
- 價格差距:52 倍;分數差距:5 分
- 流量數據
- OpenRoute(海外平台):DeepSeek 市佔 16.7%,成為平台第一大廠商(截至 7 月 13 日)
- OpenCode:7 月 31 日 3.3 萬億 Token → 8 月 9 日 9.2 萬億 Token(9 天增長接近 3 倍)
- V4 Flash 技術規格
- 總參數:2840 億
- 激活參數:130 億(每 Token)
- 在 100 萬 Token 上下文下,推理計算量約為 V3 的 10%、KV 緩存為後者的 7%
- 完整檢查點:167GB
- 部署方案
- VLLM 推薦:4 張高端 GPU(單張 256GB)
- 社區量化方案(Dorfstar):Q2 量化約 80GB,可在 96-128GB 統一內存 Mac 上運行(精度下降、上下文受限)
- Mac 短上下文實測:每秒 20 多個 Token
- 後訓練方向
- 分別訓練數學、代碼、智能體、指令遵循專家
- 使用 SFT 與強化學習強化各自能力
- 十多個教師模型的無策略蒸餾合併
- 專門設計的工具調用格式、交錯思考機制
- 內部系統提供幾十萬並發沙箱供模型練習代碼
- 選型框架(3 個問題)
- 這個任務的單次完成率,候選模型差多少?
- 算上重試,端到端完成一次任務的總 Token 是多少?
- 同樣預算,便宜模型多跑幾次並行嘗試,成功率能不能反超貴模型的單次?
- ##
結論
結論“從今天起,每一次模型調用都值得過一遍帳——完成任務花多少錢和回答有多聰明是兩件事,把這兩件事混在一起做決策的團隊會持續多付錢。”
完整解析
詳細這支影片從一個真實案例開篇:有人用 Cloud Opus 5 生成遊戲原型,反復寫代碼、跑結果、改進,累計消耗 6.9 億 Token、花費 423 美元(約 3000 人民幣)。這筆帳看似天文數字,但它暴露了一個選型的盲點:過去我們習慣按模型榜單分數選擇,默認分數高就應該多付錢。然而智能體任務的成本算法完全不同。
智能體不是一次性調用。它要自己讀文件、改代碼、跑程式、看結果,失敗了再來一次。任務可能跑幾小時,調用工具幾十次,Token 消耗翻幾十倍甚至幾百倍。這時候,榜單上幾分的能力差距只決定是否需要多試兩輪;但幾十倍的價格差距決定的是整個任務有沒有資格跑起來。講者用一個簡單的三問框架重新定義了選型邏輯:第一,這個任務的單次完成率,候選模型差多少?第二,算上重試,端到端完成一次任務的總 Token 是多少?第三,同樣預算,便宜模型多跑幾次並行嘗試,成功率能不能反超貴模型的單次?大多數時候第三個問題的答案會讓人意外——便宜模型加多次嘗試經常比貴模型加單次嘗試更划算。
就在這個問題被看清楚的時候,DeepSeek 推出了 V4 Flash 0731 版本,定價每百萬 Token 輸出 0.28 美元。對比一下:Claude Opus 4.8 是 25 美元,差了 89 倍。Artificial Analysis 的評測成本對比更直觀——V4 Flash 拿 52 分花了 72 美元,Claude Opus 4.8 拿 57 分花了 3752 美元,價差 52 倍,分差才 5 分。成本曲線突然断裂了。
市場反應也很快。OpenRoute(海外開發者集聚的模型聚合平台)數據顯示,到 7 月 13 日 DeepSeek 已經成為平台第一大模型廠商,市佔 16.7%。更直觀的信號來自 OpenCode,9 天內平台 Token 總量從 3.3 兆漲到 9.2 兆,接近 3 倍。有人猜測这是免費額度燒出來的,但講者的判斷是,免費額度能點燃第一天,燒不出連續 9 天的曲線。背後是真實的需求在轉向。
成本優化不是補貼。講者解剖了 V4 Flash 的技術底氣。總參數 2840 億,但每個 Token 只激活 130 億,配合混合注意力結構、低精度權重和針對長上下文的緩存優化。在 100 萬 Token 上下文下,推理計算量只有 V3 的 10%,KV 緩存只有 7%。同一個模型用更少的計算完成一次推理,更多請求共享緩存,成本自然就下來了。再疊加緩存命中計價和區域差異定價,緩存命中場景的輸入成本還能再降。
另一塊成本挖掘來自後訓練。DeepSeek 分別訓練了數學、代碼、智能體和指令遵循的專家模型,用強化學習加強各自能力,再通過十多個教師模型的無策略蒸餾合併回同一個模型。工具調用被當成獨立問題,設計了專門的呼叫格式減少參數轉移和格式錯誤。交錯思考讓模型拿到工具返回後能接著之前的推理繼續走。內部系統提供幾十萬並發沙箱,讓模型反复練習跑代碼、發現錯誤、改進代碼。這些改動沒增加一個新參數,卻把智能體最常見的失敗一項項修掉了。對於做 AI 產品的團隊,這部分比跑分更有參考價值。
這就回答了開頭那個問題。聊天機器人時代,用戶問一次、模型答一次,為更好的回答多付幾倍錢說得通。智能體時代,模型在循環工作,一次任務調用幾十次、Token 消耗翻幾十倍,衡量模型的單位從「單次回答有多聰明」變成了「完成一項長任務花多少錢、失敗幾次、等多久」。V4 Flash 正好把過去只有頂級模型配做的任務壓近了一個可以反复調用、持續試錯的價格區間。甚至允許你浪費一些 Token。
這場碰撞背後是兩條路線。硅骨巨頭的路線是重金訓練頂級模型、維持高毛利、重心在大客戶和高價值訂單,對普通市場的價格變化反應滯後。DeepSeek 的路線是靠工程優化壓推理成本、開源加雲服務、薄利多銷、先搶開發者、靠規模攤成本。兩條路線談不上對錯,服務的客户不同。但 DeepSeek 證明了一件事:算力投入只是入場券,推理效率、定價策略和生態運營同樣能改寫市場分額。
許多團隊的長期成本低估始於一個習慣:不計算使用成本。梁文峰在投資人交流中表過態,產品要在保留合理利潤的情況下讓更多人用得起。用得起——背後的假設是需求遠遠沒有被滿足,價格降下去用量會涨得更快。這和 Sam Altman 願成為長期低毛利但規模巨大高速增長的基礎設施公司方向一致。兩邊的掌舵人堵的是同一件事:單價降、總量涨得更快。目前的數據站在他們這邊。過去舍不得讓 AI 常駐後台的團隊開始敞開用了,原本問一次就結束的問題變成跑幾小時的智能體任務。
對開發者的直接影響已經很清楚了:選擇變多、成本下降、創新的門檻繼續往下走。這是近幾年對中小團隊最有利的窗口期。
##
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


