KeyFrame內部研究專用

英偉達DLSS 5與Cosmos 3橫空出世,物理世界徹底淪陷?😱

商業本質·7月22日週三·27 min中文

三句話摘要

英偉達在SIGGRAPH 2026宣布用生成式AI定義遊戲渲染、物理模擬與機器人訓練的完整生態,打造從數位視覺到物理世界的絕對壟斷閉環。 英偉達透過DLSS 5、AI物理模擬與Cosmos系列,完成了從計算圖形學到物理世界定義的全鏈路壟斷,未來的技術競爭不在於算力堆砌,而在於誰能最快、最逼真地生成無限的訓練環境與虛擬世界。 DLSS 5解決了生成式AI在實時遊戲中的可控性困境,透過嚴格約束AI輸入端的基礎幾何與語意數據,強制AI必須絕對尊重引擎的結構與藝術意圖,在此紅線內發揮照片級真實感。

重點整理

重點
  • 1

    DLSS 5解決了生成式AI在實時遊戲中的可控性困境,透過嚴格約束AI輸入端的基礎幾何與語意數據,強制AI必須絕對尊重引擎的結構與藝術意圖,在此紅線內發揮照片級真實感。

  • 2

    AI物理模擬把工程設計的迭代週期從「改設計等幾天」壓縮到「改設計一秒出結果」,輕量化模型(200MB)在1-2%誤差範圍內等效於傳統超級電腦(2萬張GPU),效率提升超1萬倍。

  • 3

    Cosmos 3發明通用幾何動作語言,將異形機器人統一拆解為基礎幾何基元(身體位置、執行器、抓手),使人類第一人稱視頻瞬間變成機器人的頂級訓練語料,破解了物理AI的數據枯竭瓶頸。

  • 4

    Cosmos Dreams建造不受時間限制的虛擬訓練環境,讓物理AI在毫秒級完全受控的模擬世界裡無盡試誤,研發門檻從雲端跌落到單張工作站顯卡。

實用技巧與重點

乾貨
  • DLSS 5:
  • 目標:四K解析度(800萬像素)、60幀、每幀16.6毫秒
  • 技術:單步像素空間擴散Transformer、極端模型蒸餾
  • 控制方式:結構強度滑桿(控制毛孔、微影)、色調強度滑桿(控制光影氛圍)、語意遮罩(特定物體單獨應用)
  • 物理模擬:
  • 氣象數據集:500億網格單元、1公里分辨率、2萬張GPU連續運轉計算
  • 飛機氣動模擬:2000種氣動佈局、傳統需200TB數據、AI壓縮到200MB(100萬倍壓縮)
  • 預測性能:速度1秒(vs.傳統幾天)、誤差1-2%、效率提升1萬倍以上
  • 工作平台:RTX6000工作站
  • Cosmos 3系列:
  • Cosmos 3 Nano:自動駕駛優化版本
  • Cosmos 3 Super:保真度極致版本
  • Cosmos 3 Edge:40億參數端側版本、Jetson Thor晶片支援
  • 去雜訊優化:從100步壓縮到4步、反應速度提升25倍
  • Cosmos Dreams:
  • 演進:64張GB300晶片 → 16張Vera Rubin → 單張RTX Pro 6000
  • 功能:毫秒級即時生成、包含主視角與鳥瞰圖同步、完全受控的虛擬自動駕駛環境

結論

結論

英偉達透過DLSS 5、AI物理模擬與Cosmos系列,完成了從計算圖形學到物理世界定義的全鏈路壟斷,未來的技術競爭不在於算力堆砌,而在於誰能最快、最逼真地生成無限的訓練環境與虛擬世界。

完整解析

詳細

英偉達在SIGGRAPH 2026主題演講中完整展示了一個從數位視覺延伸到物理工程、最終服務機器人訓練的完整生態系統,這套佈局徹底改寫了計算機圖形學與物理工程的遊戲規則。

演講以完美的歷史閉環開場:30年前英偉達為解決傳統電腦無法進行複雜圖形計算而發明GPU,這項技術後來意外引爆2012年的深度學習革命,而今AI長大後終於開始反哺母本行——圖形渲染領域。DLSS 5是第一個突破點。傳統圖形學從第一原理出發,透過物理模擬光線軌跡、每個像素位置由設計者精確指定,這曾是行業的驕傲,卻也成了無法突破的瓶頸。即便採用最頂級的光線追蹤技術(DES4時代水準),最終結果與真實照片級效果仍有無法逾越的鴻溝。原因在於現實世界的光影互動極度複雜——次表面散射、複雜漫反射這些現象超出傳統演算法的算力承載能力。生成式AI看似完美解決方案:用數億張現實照片訓練後,已經學會皮膚透光、頭髮分明等細微細節。但生成式模型有致命缺陷:它基於機率因此不可控,同一提示詞生成的結果每次都不同;它會自作聰明地修改藝術表達,遮蔽設計師精心設置的疤痕、加美顏濾鏡,完全無視創意意圖。

DLSS 5的解決方案激進且有效:它完全不聽提示詞,只看遊戲引擎輸出的原始數據——反照率、表面法線、基礎光照資訊。模型被嚴格訓練成死心眼,必須絕對尊重這些底層幾何與語意約束。在此紅線內,AI可以盡情發揮對真實感的理解,增加皮膚肌理、次表面散射、環境光遮蔽,改變質感但絕不改變故事線。為解決實時遊戲的時間連續性問題(遊戲無法預知玩家下一幀操作),DLSS 5透過運動向量嚴格遵循因果關係,實現一幀進一幀出的生成方式,完全消除了畫面閃爍與物體漂移。最凶悍的是速度難題:4K解析度每幀只有16.6毫秒預留時間,其中物理計算、AI邏輯、基礎渲染已佔大半,留給DLSS 5的窗口僅幾毫秒。英偉達透過極端的模型蒸餾,把幾十億參數的基礎模型壓成單步像素空間擴散Transformer,塞進毫秒級時間窗口。在演示中,開發者獲得了驚人的控制能力:調整結構強度滑桿改變毛孔細節、調整色調強度滑桿改變光影氛圍,甚至在引擎裡框選特定物體(如葡萄和酒瓶)單獨應用DLSS 5,看著葡萄變得晶瑩剔透、酒瓶呈現金屬玻璃折射,而背景木板紋絲不動。這套所見即所得的AI生成式渲染管線深度綁定英偉達的Tensor核心,意味著傳統競爭對手無論堆砌多少流處理器、翻倍算力投入,也無法在管線末端透過AI無中生有生成真實感來追趕。計算機圖形學正式進入新紀元。

第二個突破是AI驅動的物理模擬,其威力直指工程與科學領域的核心。氣象預測的傳統做法需要2萬張頂級GPU連續運轉,才能算出地球氣候模擬(500億網格單元、1公里分辨率)的結果。英偉達的做法同樣激進:不讓AI硬背物理公式,而是把40年積累的氣象觀測數據與最高精度傳統模擬數據全部餵進去,讓AI像學語言一樣自然領悟流體熱力學的運作規律。結果是訓練好的模型只需幾秒到幾分鐘在普通硬體上運行,預測精度反而比傳統數值模擬更高,已被全球頂級氣象中心投入實際生產。更震撼的突破出現在飛機氣動模擬領域:傳統方法要模擬2000種不同的氣動佈局(超過10億自由度),會產生200TB的龐大數據集,英偉達用Transformer架構與聰明的Tokenization技術訓練出的AI模型只有200MB——接近100萬倍的資料壓縮比。更令人驚愕的是速度與泛化能力:模型面對完全未見過的飛機幾何形狀與全新邊界條件,在普通的RTX6000工作站上一秒內就能預測出氣流分佈,誤差僅1-2%,完全符合嚴謹的物理規律。傳統工程流程是改一次設計要等幾天才能看到模擬結果,現在改一次設計一秒鐘出結果,效率整整提升超過1萬倍。這意味著波音、空中巴士、特斯拉可以直接把這個輕量化、物理正確的AI模擬引擎插進設計軟體裡,設計師改變車子尾翼時軟體在毫秒級告訴風阻降幅,散熱工程師改變機殼進風口時立刻看到熱流變化。

第三個突破是Cosmos 3世界模型與Cosmos Dreams虛擬環境,這才是整個佈局的終極目的。物理AI產業的死穴是數據枯竭:語言大模型能爆發因為網際網路存著人類幾十年敲下的海量文本,但機器人要學習做飯、躲避行人、廚房煎雞蛋這些物理直覺,網路上根本沒有現成的語料包。傳統做法是真槍實彈收集數據——訓練自動駕駛要派車隊在馬路上跑幾千萬公里,訓練機械手臂要讓人帶著VR頭顯一次次控制機械手臂去抓積木。這種遙操作收集的數據雖然精準,但效率低得令人髮指,因為現實世界的時間是按秒計算的,你無法對著現實世界按快轉鍵。Cosmos的核心創新是發明了通用幾何動作語言:把所有異形機器人統一拆解為最基礎的幾何基元——身體位置(ego pose)、執行器位置(effectors)、抓手動作(grippers)。這套語言一經確立,發生了產業級的顛覆性變化:人類帶著GoPro在廚房做飯的第一人稱視頻,突然全部變成了機器人的頂級訓練教材。Cosmos透過逆向動力學看完烹飪視頻,立刻能反推出做菜時的關節受力與空間軌跡,直接把這套動作邏輯裝進機器人的大腦。從前那些看似無用的網紅煮飯視頻,現在全成了餵食物理AI的頂級語料庫。Cosmos 3系列包括Nano版本(針對自動駕駕優化)、Super版本(追求極致保真度)、Edge版本(40億參數的端側輕量版)。Edge版本的實機演示展示了邊界端真實控制的完整樣態:一個機械手臂盯著桌上的灰色方塊,其底座裡插著搭載Jetson Thor晶片的計算板,這個40億參數的Cosmos 3 Edge模型就在本地晶片上運轉,直接透過攝影機看著方塊不僅能瞬間看懂材質與空間位置,還能毫秒級預測出自己的抓取動作結果,直接指揮機械手臂一把抓起方塊。整個過程沒有任何雲端伺服器參與,沒有往返傳輸的網路延遲。英偉達甚至把去雜訊的步數從100壓縮到4,讓圖像生成的反應速度足足飆升了25倍。

最後的高潮是Cosmos Dreams——實時虛擬自動駕駛閉環模擬器。舞台上工程師拿著PS4手柄控制螢幕裡的自動駕駛汽車,Cosmos立刻根據現實世界的物理規律與光影邏輯即時生成每一幀畫面,包含正前方主視角與右下角的鳥瞰圖同步生成,毫秒級完成,這不是放錄影、不是GTA5遊戲畫面,而是Cosmos在即時生成的AI夢境。汽車的AI演算法其實正行駛在Cosmos編織的逼真夢境裡,遇到加塞、遇到暴雨、遇到鬼探頭都會得到完全符合現實物理法則的回饋。車企甚至無須把測試車開上街,直接把自動駕駛的策略模型接進Cosmos Dreams就可以做無盡的被動驗證與極端場景訓練。計算成本的優化更是驚人:幾個月前這套系統需要64張GB300等級的頂級晶片並聯才能勉強運行,後來優化到16張Vera Rubin晶片,而在SIGGRAPH 2026的舞台上,整個高傳真閉環虛擬自動駕駛模擬器只需要一張RTX Pro 6000工作站顯卡就能流暢運行。一張單卡跑了一整個虛擬實體世界。當算力成本壓縮到這個地步時,物理AI與機器人產業的研發門檻直接從雲端跌落到車庫級別,任何創業公司只要買一台英偉達工作站,就等於擁有了一個可以無限折疊時間與空間、無限試誤的完美訓練環境。

英偉達現在的野心已經遠超傳統「賣鏟子」的算力供應商模式,它正在親手搭建一條從數位到物理、從軟體到硬體的絕對壟斷閉環:提供開發者底層算力、給工程師提供物理模擬引擎、最後發給未來的機器人大腦。在這個新紀元裡,不再是代碼定義遊戲,而是生成式AI直接定義世界;不再是車隊去馬路上苦苦收集數據,而是算力直接湧現數據。未來的商業競爭決勝點是誰能掌握建構虛擬世界的速度與保真度,誰就能控制物理AI進化的速度。而在這條賽道上,英偉達已經不是在領跑,它是在親手制定物理世界的全新作業系統。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。