KeyFrame內部研究專用

AI推理市场会超过石油行业 | Dylan Patel | 人生经历 | InferenceX | 帕累托最优 | 单位瓦特智能 | 软硬协同设计 | CUDA护城河 | 太空数据中心 | 黄仁勋战略

Best Partners TV·7月5日週日·21 min中文

三句話摘要

Samananicis創始人迪伦·帕特爾對AI推理市場規模、算力戰爭終局和軟硬協同設計的深度產業分析。 迪伦的核心邏輯清晰:AI推理市場空間足夠大以支撐完全不同的技術路線與玩家,軟硬協同設計是接下來效率提升的決定性力量,算力戰爭的終局本質是能源與生態的戰爭——地面能源極限推動算力上太空,生態博弈讓行業走向多極化而非一家獨大。 推理市場規模與InferenceX基準平台:推理成本持續下降、Token消耗爆發增長,推動推理市場成為全球最大單一產業,規模遠超石油。InferenceX解決傳統靜態測試快速過時的問題,打造動態「會呼吸」的基準測試平台,每天在15種芯片上運行最前沿模型,所有結果完全公開。

重點整理

重點
  • 1

    推理市場規模與InferenceX基準平台:推理成本持續下降、Token消耗爆發增長,推動推理市場成為全球最大單一產業,規模遠超石油。InferenceX解決傳統靜態測試快速過時的問題,打造動態「會呼吸」的基準測試平台,每天在15種芯片上運行最前沿模型,所有結果完全公開。

  • 2

    軟硬協同設計的決定性力量:性能提升來源三層驅動——模型層、軟件層、硬件層都在創新,但打通三層協同優化能實現百倍增益,遠超單層提升的倍數效應。這種跨抽象層的協同優化是頂尖實驗室的核心競爭力。

  • 3

    能源極限推動算力上太空:地面能源生產物理極限將於20年後顯現,到2040年算力用電達到太瓦級別,此後絕大多數新增算力必然部署在太空,根本性改變計算基礎設施布局。

  • 4

    GPU與TPU各有勝負,生態適配決定勝者:GPT與TPU的競爭本質不是硬件對硬件,而是軟硬協同生態對生態。模型架構設計決定硬件選擇,谷歌與OpenAI分別基於自身硬件架構優化模型,形成自循環生態,下游企業傾向選擇適配模型的硬件。

實用技巧與重點

乾貨
  • 硬件與能源數據
  • InferenceX硬件捐贈總價值超5000萬美元,加上TPU與Trainers芯片超1億美元
  • 英伟达GPU產量數千萬顆/年,谷歌TPU將超千萬顆/年,兩者年產值均達千億美元級
  • 2030年OpenAI和Anthropic用電量合計超100幾瓦
  • 2040年算力用電達太瓦級別
  • 當前最新英伟达芯片功耗1400瓦,下代Rubin為2000瓦,Rubin Ultra為4000瓦
  • 效率提升指標
  • 過去三年單位瓦特智能提升接近40倍,成本下降約60倍
  • Hopper到Blackwell三年間DeepSeek性能提升30倍
  • 千象小模型(270億參數,20億激活參數)遠超三年前的大模型
  • 商業數據
  • Anthropic單Token毛利超80%,算力成本翻倍後仍能保持50%毛利
  • 全球算力部署季度創新高,今年新增20幾瓦,明年超過30幾瓦
  • 谷歌數據中心單位電力配套能部署1.5倍硬件量(通過負載調度與電力管理)
  • 技術細節
  • DeepSeek、月之暗面、質普等已具備自定義CUDA內核開發能力
  • SRAM芯片難以運行超10萬億參數、百萬Token級別上下文模型
  • Cyberus等專用芯片在高端任務上性能出色但擴展性受限

結論

結論

迪伦的核心邏輯清晰:AI推理市場空間足夠大以支撐完全不同的技術路線與玩家,軟硬協同設計是接下來效率提升的決定性力量,算力戰爭的終局本質是能源與生態的戰爭——地面能源極限推動算力上太空,生態博弈讓行業走向多極化而非一家獨大。

完整解析

詳細

迪伦·帕特爾在小商人家庭長大,父母經營汽車旅館與加油站,他從小在店裡幫忙,最早的「神經網絡」就是根據顧客外貌預判香煙購買偏好。8歲時收到Xbox 360,發現死亡紅環故障時自己短接溫度傳感器修好了機器,從此踏入硬件領域。12歲時已深度沉迷科技論壇,成為安卓、蘋果、谷歌等多個硬件版塊版主,時的判斷——英伟達技術優於AMD,能用更小芯片實現更高性能——後來被市場驗證。大學後拿到量化分析師職位,為公司創造數百萬美元無風險收益卻遭功勞被搶,同時面臨祖母逝世、感情挫折與疫情衝擊,一度陷入人生低谷。2021年24歲生日推出Samananicis博客,從匿名網友轉向深度研究平台,關注度隨之爆發。

其後迪伦一直奔波於40多場行業會議,從AI學術頂會到光學膜專業會議,逐層深化對半導體供應鏈的理解。Samananicis的核心平台InferenceX解決了傳統推理基準測試的「時間快照」問題——新模型層出不窮,軟件框架與驅動更新節奏極快,靜態測試無法跟蹤。他們構建了動態基準測試系統,通過行業聲望獲得Kowalski、Crusell、Nibbius、甲骨文、微软、阿姆尚、谷歌和OpenEye的硬件支持,每天在15種芯片上運行最前沿模型,將無數參數配置與優化方案自動化測試,結果完全公開。這套系統發現的「帕雷托最優曲線」對比吞吐量與延迟,極速響應場景與批量處理場景對應不同批處理大小,衍生出差異化定價邏輯——Anthropic的Claude快速模式、OpenAI的優先級隊列本質上都在這條曲線上做定價區隔。

訪談深入技術層面,迪伦強調性能提升不是硬件單方驅動,而是模型、軟件、硬件三層協同的結果。過去三年,儘管硬件僅經歷Hopper到Blackwell一代更新,DeepSeek性能提升30倍,但整體單位瓦特智能提升遠超此數字——模型層的貢獻巨大,千象這類270億參數模型(僅20億激活參數)已遠超三年前大模型。真正的飛躍來自軟硬協同優化:DeepSeek V3針對Hopper架構優化張量形状,Llama 3.5針對Blackwell與華為芯片優化,涉及網絡I/O模式、集合通信管理、融合算子處理,單層提升兩倍三層加起,但打通三層協同能實現百倍增益——這正是頂尖實驗室與英伟达、台積電的核心競爭力。

迪伦對技術瓶頸的分析同樣深刻。內存容量與帶宽提升極其緩慢——NAND存儲單元是25年前發明,DRAM更是40年前技術,底層結構至今無重大突破,近五年無非是將HBM堆更高、速度做更快。未來突破方向是直接在芯片上堆疊內存,實現帶宽爆炸式增長。另一瓶頸是功耗密度:過去20年,芯片功耗密度穩定在每平方毫米約1瓦,但現在最新英伟达芯片已達1400瓦,下代Rubin達2000瓦,Rubin Ultra達4000瓦,這推動行業突破功率密度限制。

關於GPU與TPU競爭,迪伦認為這根本非黑即白。谷歌TPU年產量將超千萬顆,英伟达GPU為幾千萬顆,兩者都將達千億美元級產值。勝負取決於軟硬協同設計:OpenAI模型結構稀疏,Anthropic模型更偏稠密,對硬件需求截然不同;英伟达採NVLink交換機連接,谷歌採芯片間互聯無交換機,拓撲結構各有優劣,反過來影響模型架構。傳統的「CUDA護城河」敘事已過時——DeepSeek等實驗室早已自主開發內核,寫自定義CUDA核函數並非難事,真正的護城河是下游模型生態的適配,DeepSeek在GPU上跑比TPU好,Gemini在TPU上表現出色,開源生態自然傾向適配的硬件。頂級實驗室根本不依賴開源棧,OpenAI已分支PyTorch,Anthropic與Anthropic有自有系統,能從底層協同優化。

訪談觸及專用芯片如Cerebras,迪伦認為其創新力強、細分領域出色,快速生成Token很有價值。但其SRAM架構運行超大規模模型困難——未來若模型超10萬億參數、上下文達百萬Token級,這類芯片無法容納。而頂級實驗室收入與使用量集中在最頂級模型,即使漲價用戶仍往高階遷移,給專用芯片長期發展帶來不確定性。

成本精細化是Samananicis優勢所在:每天追踪團隊內所有人Token支出,使用量飆升時逐一確認必要性。這種成本意識使他們將算力經濟賬算透,進而推導出AI推理市場規模超越石油的判斷——推理成本下降曲線與Token消耗爆發增長,支撐這個推論。

迪伦強烈反駁AI無ROI、模型無實質進步的說法,稱這最令他生氣。AI模型能力發展軌跡一直向上,舊基準已飽和但新基準分數直線飆升。新代模型進入自我改進階段,在輔助編寫基礎設施後加速下一代發布,形成自循環。拉長時間線到十年,他最看好太空——太空數據中心、小行星採礦、SpaceX願景都令他興奮,雖強調非投資建議,但爭議只在具體哪一年。更長期方向包括類比計算與機械能結合、全棧創新,儘管多數失敗但宏大設想本身令人興奮。

行業最終格局:每家公司都會自研芯片,這是必然。供應鏈多元化,各自硬件物理結構大同小異(中心邏輯裸片、周圍高帶寬內存、頂部網絡通信、底部I/O管理),但存在局部最優陷阱——專用ASIC針對當下架構極致優化,若注意力機制被其他技術取代就難以轉身。因此谷歌同時推進多個不同架構TPU項目避坑。通用GPU因客戶群龐大、需求多樣,永遠保持通用性。多樣化將長期存在,市場足夠大讓英伟达、TPU、Trinium等主流玩家與眾多小眾公司各得其所。

算力紧缺現象的根本原因:模型能力提升帶來的需求增長,遠超算力供給增長。新模型發佈後任務範圍擴大,總潛在市場指數級增長,但算力供給未同步翻倍。只要模型創造的毛利遠超算力成本,投入就穩賺——Anthropic單Token毛利超80%,算力成本翻倍後仍保50%,絕不惜一切代價租算力。只要模型擴展工作總價值速度趕上算力產能擴張速度就無問題;若模型進步突然停滯潮水才會退去,但目前模型進步還在加速,算力短缺狀態續。

數據中心壁壘轉變:不同廠商算力價值不等,1瓦≠1瓦。谷歌數據中心通過極強負載調度與電力管理,單位電力配套能部署1.5倍硬件,與電網簽協議時甚至要求超常規供電,在電網最緊張時配合降載。未來數據中心核心壁壘不再是物理規模,而是頂級電力管理能力、電力質量、負載調度水平,直接決定盈利能力。市場已出現大幅價格分化。

新興云廠商如Nioclots、Crusell的崛起挑戰傳統云市場超大規模贏者通吃格局。原因簡單:傳統云優勢在AI時代反成劣勢——Amazon的安全隔離與資源利用率在AI場景下性能跟不上,傳統安全開銷與網絡架構為CPU工作負載設計,適配AI負載水土不服;大公司組織架構跟不上AI爆發建設速度。新興云廠商團隊激勵直接、交付快速,抓住窗口期。

黃仁勳戰略透澈之處:最不想看到超大規模云廠商掌握所有算力。若只有幾家云巨頭建設、用自研TPU與Trainers芯片,英伟达陷絕境。故到處投資新興AI實驗室、扶持新興云廠商、給他們做新用DODE,本質構建多極化計算生態——現在賣GPU給新興云與賣給云巨頭收入相同,但五年後這些新興廠商就成對抗云巨頭自研芯片的力量,整個生態更依賴英伟达通用算力。如同往水裡撒鱼,總有最聰慧的鱼脫穎而出,新興公司多數倒下但只要跑出數家優秀的英伟达多極化戰略就成功。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。