KeyFrame內部研究專用

DeepSeek这条斩杀线,斩的是谁

Why QQ·8月13日週四·14 min中文

三句話摘要

AI 模型定價戰爭與智能體時代的成本革命——從榜單對比到實際成本計算的範式轉移。 ## 從今天起,每一次模型調用都值得過一遍帳——完成任務花多少錢和回答有多聰明是兩件事,把這兩件事混在一起做決策的團隊會持續多付錢。 成本計算方式的轉變:過去選模型只看榜單分數,現在必須計算完成一項實際任務的總成本。智能體不是問一次就結束,而是循環讀文件、改代碼、跑程試、看結果,失敗重試,Token 消耗可以翻幾十倍甚至幾百倍。幾分能力差距影響是否需要多試兩輪,幾十倍的價格差距才決定任務有沒有資格跑起來。

重點整理

重點
  • 1

    成本計算方式的轉變:過去選模型只看榜單分數,現在必須計算完成一項實際任務的總成本。智能體不是問一次就結束,而是循環讀文件、改代碼、跑程試、看結果,失敗重試,Token 消耗可以翻幾十倍甚至幾百倍。幾分能力差距影響是否需要多試兩輪,幾十倍的價格差距才決定任務有沒有資格跑起來。

  • 2

    成本優化的技術底氣:V4 Flash 的低價不是補貼,而是工程優化的結果。總參數 2840 億但只激活 130 億(配合混合注意力結構)、長上下文緩存優化、後訓練針對編碼與智能體任務、專門設計的工具調用格式。這些都沒增加參數卻讓智能體最常見的失敗一項項修掉了。

  • 3

    市場實際流向:不只是免費額度燒出來的泡沫。OpenCode 9 天內平台 Token 總量升 3 倍,開發者團隊開始敞開用 AI 後台,把原本一次性提問變成數小時的智能體任務。海外平台 OpenRoute 數據顯示 DeepSeek 成為第一大模型廠商。

  • 4

    「斬殺線」對中間層的威脅:最弱的小模型本來就便宜、最強的旗艦有不可替代的場景,真正難受的是中間層——比 V4 Flash 強卻貴幾十倍,但又沒強到能穩定解決 Flash 做不了的問題。這層模型只要大多數時候能把活幹完就會被擠出默認調用位。

  • 5

    ##

實用技巧與重點

乾貨
  • 定價數據(截至 2026 年 8 月)
  • DeepSeek V4 Flash:0.28 美元/百萬 Token(輸出);0.0028 美元/百萬 Token(緩存命中輸入)
  • Claude Opus 4.8:25 美元/百萬 Token(輸出)
  • Claude Sonnet、Gemini:均高出幾倍
  • GPT 5.6:輸出價 1.2 美元上下
  • Artificial Analysis 評測對比
  • V4 Flash:52 分,評測成本 72 美元,生成 2.1 億 Token
  • Claude Opus 4.8:57 分,評測成本 3752 美元,生成 1.2 億 Token
  • 價格差距:52 倍;分數差距:5 分
  • 流量數據
  • OpenRoute(海外平台):DeepSeek 市佔 16.7%,成為平台第一大廠商(截至 7 月 13 日)
  • OpenCode:7 月 31 日 3.3 萬億 Token → 8 月 9 日 9.2 萬億 Token(9 天增長接近 3 倍)
  • V4 Flash 技術規格
  • 總參數:2840 億
  • 激活參數:130 億(每 Token)
  • 在 100 萬 Token 上下文下,推理計算量約為 V3 的 10%、KV 緩存為後者的 7%
  • 完整檢查點:167GB
  • 部署方案
  • VLLM 推薦:4 張高端 GPU(單張 256GB)
  • 社區量化方案(Dorfstar):Q2 量化約 80GB,可在 96-128GB 統一內存 Mac 上運行(精度下降、上下文受限)
  • Mac 短上下文實測:每秒 20 多個 Token
  • 後訓練方向
  • 分別訓練數學、代碼、智能體、指令遵循專家
  • 使用 SFT 與強化學習強化各自能力
  • 十多個教師模型的無策略蒸餾合併
  • 專門設計的工具調用格式、交錯思考機制
  • 內部系統提供幾十萬並發沙箱供模型練習代碼
  • 選型框架(3 個問題)
  • 這個任務的單次完成率,候選模型差多少?
  • 算上重試,端到端完成一次任務的總 Token 是多少?
  • 同樣預算,便宜模型多跑幾次並行嘗試,成功率能不能反超貴模型的單次?
  • ##

結論

結論

從今天起,每一次模型調用都值得過一遍帳——完成任務花多少錢和回答有多聰明是兩件事,把這兩件事混在一起做決策的團隊會持續多付錢。

完整解析

詳細

這支影片從一個真實案例開篇:有人用 Cloud Opus 5 生成遊戲原型,反復寫代碼、跑結果、改進,累計消耗 6.9 億 Token、花費 423 美元(約 3000 人民幣)。這筆帳看似天文數字,但它暴露了一個選型的盲點:過去我們習慣按模型榜單分數選擇,默認分數高就應該多付錢。然而智能體任務的成本算法完全不同。

智能體不是一次性調用。它要自己讀文件、改代碼、跑程式、看結果,失敗了再來一次。任務可能跑幾小時,調用工具幾十次,Token 消耗翻幾十倍甚至幾百倍。這時候,榜單上幾分的能力差距只決定是否需要多試兩輪;但幾十倍的價格差距決定的是整個任務有沒有資格跑起來。講者用一個簡單的三問框架重新定義了選型邏輯:第一,這個任務的單次完成率,候選模型差多少?第二,算上重試,端到端完成一次任務的總 Token 是多少?第三,同樣預算,便宜模型多跑幾次並行嘗試,成功率能不能反超貴模型的單次?大多數時候第三個問題的答案會讓人意外——便宜模型加多次嘗試經常比貴模型加單次嘗試更划算。

就在這個問題被看清楚的時候,DeepSeek 推出了 V4 Flash 0731 版本,定價每百萬 Token 輸出 0.28 美元。對比一下:Claude Opus 4.8 是 25 美元,差了 89 倍。Artificial Analysis 的評測成本對比更直觀——V4 Flash 拿 52 分花了 72 美元,Claude Opus 4.8 拿 57 分花了 3752 美元,價差 52 倍,分差才 5 分。成本曲線突然断裂了。

市場反應也很快。OpenRoute(海外開發者集聚的模型聚合平台)數據顯示,到 7 月 13 日 DeepSeek 已經成為平台第一大模型廠商,市佔 16.7%。更直觀的信號來自 OpenCode,9 天內平台 Token 總量從 3.3 兆漲到 9.2 兆,接近 3 倍。有人猜測这是免費額度燒出來的,但講者的判斷是,免費額度能點燃第一天,燒不出連續 9 天的曲線。背後是真實的需求在轉向。

成本優化不是補貼。講者解剖了 V4 Flash 的技術底氣。總參數 2840 億,但每個 Token 只激活 130 億,配合混合注意力結構、低精度權重和針對長上下文的緩存優化。在 100 萬 Token 上下文下,推理計算量只有 V3 的 10%,KV 緩存只有 7%。同一個模型用更少的計算完成一次推理,更多請求共享緩存,成本自然就下來了。再疊加緩存命中計價和區域差異定價,緩存命中場景的輸入成本還能再降。

另一塊成本挖掘來自後訓練。DeepSeek 分別訓練了數學、代碼、智能體和指令遵循的專家模型,用強化學習加強各自能力,再通過十多個教師模型的無策略蒸餾合併回同一個模型。工具調用被當成獨立問題,設計了專門的呼叫格式減少參數轉移和格式錯誤。交錯思考讓模型拿到工具返回後能接著之前的推理繼續走。內部系統提供幾十萬並發沙箱,讓模型反复練習跑代碼、發現錯誤、改進代碼。這些改動沒增加一個新參數,卻把智能體最常見的失敗一項項修掉了。對於做 AI 產品的團隊,這部分比跑分更有參考價值。

這就回答了開頭那個問題。聊天機器人時代,用戶問一次、模型答一次,為更好的回答多付幾倍錢說得通。智能體時代,模型在循環工作,一次任務調用幾十次、Token 消耗翻幾十倍,衡量模型的單位從「單次回答有多聰明」變成了「完成一項長任務花多少錢、失敗幾次、等多久」。V4 Flash 正好把過去只有頂級模型配做的任務壓近了一個可以反复調用、持續試錯的價格區間。甚至允許你浪費一些 Token。

這場碰撞背後是兩條路線。硅骨巨頭的路線是重金訓練頂級模型、維持高毛利、重心在大客戶和高價值訂單,對普通市場的價格變化反應滯後。DeepSeek 的路線是靠工程優化壓推理成本、開源加雲服務、薄利多銷、先搶開發者、靠規模攤成本。兩條路線談不上對錯,服務的客户不同。但 DeepSeek 證明了一件事:算力投入只是入場券,推理效率、定價策略和生態運營同樣能改寫市場分額。

許多團隊的長期成本低估始於一個習慣:不計算使用成本。梁文峰在投資人交流中表過態,產品要在保留合理利潤的情況下讓更多人用得起。用得起——背後的假設是需求遠遠沒有被滿足,價格降下去用量會涨得更快。這和 Sam Altman 願成為長期低毛利但規模巨大高速增長的基礎設施公司方向一致。兩邊的掌舵人堵的是同一件事:單價降、總量涨得更快。目前的數據站在他們這邊。過去舍不得讓 AI 常駐後台的團隊開始敞開用了,原本問一次就結束的問題變成跑幾小時的智能體任務。

對開發者的直接影響已經很清楚了:選擇變多、成本下降、創新的門檻繼續往下走。這是近幾年對中小團隊最有利的窗口期。

##

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。