KeyFrame內部研究專用

Why NVIDIA is Building Open-Source Large Models | Bryan Catanzaro | Nemotron | Model Distillation...

最佳拍档·7月8日週三·29 min中文

三句話摘要

英偉達為什麼要投入巨資免費開源大模型?芯片巨頭的商業邏輯、技術創新與組織文化。 英偉達開源大模型的真實邏輯是:站在更底層用模型研發反推硬件設計,用開源技術繁榮生態,讓所有AI創新最終都跑在英偉達的算力之上——一種比直接做應用更高維的商業策略。 開源是AI落地的基石

重點整理

重點
  • 1

    開源是AI落地的基石

  • 2

    企業客戶選擇開源模型的根本原因是保護商業機密。每家公司都有核心秘密——獨有知識產權、業務流程、客戶理解——而AI的價值極度依賴輸入數據品質。開源模型讓企業自控數據處理、自定義安全護欄、根據需求深度定制,這種定制需求只會越來越強。

  • 3

    做大模型是為了設計更好的芯片

  • 4

    摩爾定律失效後,芯片性能提升不能再靠簡單工藝縮小,必須靠極致專業化。專業化來自對工作負載的深刻理解——只有自己親手做過模型訓練推理,才知道什麼架構真正好用。同時支撐開發者生態,讓所有公司都能構建自己的AI,繁榮生態帶來英偉達的業務增長。

  • 5

    技術創新聚焦計算效率

  • 6

    Nimotro 3的突破包括四位精度訓練(降低能耗、節省帶寬)、混合架構(Transformer加狀態空間模型各取所長)、隱蔽式MOE(同成本專家數翻4倍)、多token預測(利用GPU閒置算力)。摘要:應對能源與經濟極限,效率成唯一出路。

  • 7

    開源比閉源更安全

  • 8

    陽光是最好的防護劑——更多人審視一項技術的安全性,本質上比一小撮人替所有人做安全決定更可靠。AI多樣性探索比單一管控更安全,這是人類幾百年信息自由的經驗。

實用技巧與重點

乾貨
  • Nimotro 版本演進
  • 初代(2021年):5300億參數,與微軟合作,當時名稱 Magchon Turning NLG
  • Nimotro 1:首個基於Llama的推理優化模型
  • Nimotro 2:加入MOE(混合專家模型)
  • Nimotro 3:混合架構,應用四位精度訓練
  • Nimotro 4:2024年發布3400億參數版本
  • 產品規格
  • NANO:300億參數,激活參數30億,適合輕量任務
  • SUPER:1200億參數,激活參數120億,最受歡迎
  • AUCHO:5500億參數,激活參數550億,複雜場景
  • 核心技術突破
  • 四位精度(NVFP4格式)預訓練:數據傳輸成本低、占內存小、降低能耗
  • 混合架構:狀態空間模型(全局理解)+ Transformer(細節提取)
  • 隱蔽式MOE:壓縮token向量傳輸,節省帶寬,同成本專家數翻4倍
  • 多token預測:一次預測多個token,利用GPU閒置算力加速推理
  • 多教師蒸餾(MOPD):10-15個領域教師模型融合,每個領域各自優化
  • 上下文窗口:100萬token
  • 後訓練數據
  • 商業數據集:購買有開源再分發權限的數據
  • 合成數據:用算力運行模型生成,部分開源
  • 組織與資源協作
  • 10個跨部門團隊參與大模型開發
  • 使命級老闆制度:跨職位邊界協作
  • NIMOTRO由AI軟件團隊與Megatron團隊合併而來
  • 內部開放志願者機制與創意分享網站
  • 資源分配:每兩週審查一次,項目制度量
  • 自舉模式:小實驗→展示結果→申請資源→滾雪球
  • Nimotro聯盟(2024年3月成立):非排他性,合作伙伴共同參與
  • 布蘭恩職業經歷
  • 2008年加入英偉達:研究GPU計算於AI
  • 2012-2014年在百度矽谷AI實驗室工作
  • 2016年黃仁勳邀請回英偉達組建應用研究實驗室
  • 參與項目:DLSS(實時圖形AI超分,10年研究)、Megatron、Nimotro
  • 摩爾定律失效的影響
  • 經體管持續變小但成本上升(失效5-10年)
  • 必須全鏈路協同優化:從經體管到算法到應用
  • 加速計算成為核心
  • 智能觀點
  • 反對奇點理論:智能多元化、情景化,不是簡單馬力堆砌
  • AI是人類的外部大腦,像廚房對消化一樣,會深刻改變文明
  • 開源比閉源更安全:多元審視優於單一管控

結論

結論

英偉達開源大模型的真實邏輯是:站在更底層用模型研發反推硬件設計,用開源技術繁榮生態,讓所有AI創新最終都跑在英偉達的算力之上——一種比直接做應用更高維的商業策略。

完整解析

詳細

英偉達應用深度學習研究副總裁布蘭恩·卡坦扎羅在此次訪談中解答了為什麼全球頂級芯片公司要投入巨資開發並免費開源大模型的深層邏輯。這不是品牌公關,而是完整的商業戰略。

開源AI的必要性首先源於行業發展規律。布蘭恩用互聯網歷史做類比——互聯網早期也有AOL、Compuserve等封閉平台,最終改變世界的卻是開放的互聯網。正因為開放,零售、醫療、製造等完全不同的行業各自發展出符合自身需求的應用形態。AI也必然走同樣的路。站在企業客戶角度,選擇開源模型的核心原因很實際:每家公司的競爭力來自核心秘密——獨有知識產權、業務流程、對客戶的理解。AI的價值極度依賴輸入數據品質,當AI與企業核心機密深度結合時才能產生最大價值。但這些數據涉及商業機密、監管合規,必須謹慎處理。開源模型讓企業自控數據、自定義安全護欄、根據需求深度定制——這正是未來AI落地的必然方向。

英偉達做大模型的目標有兩個層面。第一層是硬件設計。摩爾定律失效5-10年意味著芯片性能提升的傳統路線走不通了——經體管雖然繼續變小但成本反而上升。在這個新現實下,芯片性能提升必須靠極致的專業化,而專業化來自於對工作負載的深刻理解。只有自己親手做過大規模模型訓練和推理,才真正知道什麼樣的芯片架構、什麼樣的GPU互聯方案是真正好用的。Blackwell架構為什麼在MOE推理上表現優異?因為在設計時就對MOE的運作邏輯有深刻理解,把不同專家分配到不同GPU上,token在GPU間動態路由,所以才有NVLink 72的專門設計。第二層是生態建設。英偉達最寶貴的資產就是全球用英偉達技術做AI的開發者社區。每次AI技術突破最終都帶來英偉達的業務增長。英偉達不想做生態裡唯一的技術提供商,而是讓所有大小公司都有能力構建和部署自己的AI。當整個生態繁榮時,所有創新最終都跑在英偉達的算力上。

從Nimotro的技術演進可以看出這家公司的決策邏輯。最早的初代模型是2021年與微軟合作訓練的5300億參數模型(當時叫Magchon Turning NLG),之後演變成Nimotro 1、2、3。每個版本都是應對行業變化——Llama發布後做基於Llama的推理優化,隨著MOE在業界興起就加入混合專家模型。最新的Nimotro 3系列推出三個規格:輕量版NANO(激活參數30億)、最受歡迎的SUPER(激活參數120億、總參數1200億)、高性能AUCHO(激活參數550億)。

技術創新的核心指向是計算效率。這不是偶然——英偉達本質上是加速計算公司,必然從第一性原理出發思考模型設計。最代表性的突破是四位精度預訓練。四位格式只能表示16個數值,像把彩色圖片做色調分離,數據傳輸成本低、占內存小。推理的四位量化已經成熟,但預訓練用四位難得多,因為優化器對數值精度敏感,稍有不慎模型就發散。英偉達通過大量算法創新用NVFP4格式實現了這一突破。另一個重要創新是混合架構,把Transformer與狀態空間模型結合。狀態空間模型擅長對訓練做全局整體理解,把每一部分信息匯總到固定大小的緩存;Transformer的注意力機制擅長精準提取細節。兩者結合不但速度快,而且模型本身變聰明了。隱蔽式MOE通過壓縮token向量傳輸節省網絡帶寬,同樣推理成本下專家數量可翻4倍。多token預測利用GPU的閒置算力——當跑小批次時大部分時間花在讀權重上,讓模型一次預測5個token,讀一次權重就完成多部計算,第一個token確定、後面幾個可能不對,但下一輪驗證,正確的採納、錯誤的丟棄,既不損失準確率又帶來可觀速度提升。多教師蒸餾用10-15個領域教師模型融合到一個學生模型,每個團隊專注優化自己領域的教師,最後融合,完美解決了大團隊協作中不同方向拉扯的問題。

從組織維度看,英偉達維持創業精神的祕訣是「使命級老闆」而非職位級。約10個來自企業軟件、AI軟件、硬件設計等不同部門的團隊都深度參與大模型開發。NIMOTRO這個名字本身就是協作的產物——AI軟件團隊和大模型系統團隊(Megatron)打破壁壘後合併而來。公司內部有開放志願者機制,有創意分享網站,所有想法都能提交,負責不同模塊的人評估後好想法就落地到下一輪迭代。資源分配是項目制,每兩週審查一次,雖然很難因為每個研究員都想要更多GPU。小項目用「自舉模式」——先做小實驗拿到正向結果展示給大家,申請多一點資源再往前推進,拿結果換資源,慢慢滾雪球。登月級項目是自上而下加自下而上的結合,黃仁勳有戰略決策(比如大力投入NV-FP4硬件)但技術實現完全靠研究員自己摸索。這種制度靠強大的共識維繫——英偉達文化裡有一句話「沒有人會獨自失敗」,加速計算是全鏈路事情,任何環節掉鏈子整個系統價值就歸零,一榮俱榮一損俱損。

布蘭恩的職業軌跡也反映了這家公司的長期視野。2008年他還是研究生時加入英偉達,當時在GPU上訓練神經網絡完全是逆潮流。他在機器學習大會發表論文時有人直接問他為什麼來這會,說這裡都是研究高深數學、算力根本不重要。2012年他跟隨文達去百度硅谷AI實驗室工作兩年半,親眼見證AI在實際業務中的落地。2016年黃仁勳給他打電話邀請回英偉達組建應用研究實驗室,他毫不猶豫答應了。他參與的第一個項目DLSS(實時圖形AI超分)花了整整10年研究——不用計算每一幀的每個像素,用AI推斷生成剩下的畫面,效率能提升10倍。同時啟動的Megatron框架後來支撐全世界絕大多數大模型訓練。2017年Transformer剛出來時,布蘭恩就結合百度的經驗判斷這會帶來推理能力的飛躍,推動AI在所有領域落地,於是啟動了這個項目,最終證明了在GPU上也能訓練最大規模的Transformer模型。

最後到哲學層面,布蘭恩反對奇點理論,認為智能是極度多元化和情景化的。一家公司選CEO不會去找國際奧數冠�軍,管理公司需要完全不同的能力。做音樂、藝術也需要不同的天賦。原始智力像發動機馬力,但沒有輪子的引擎哪也去不了,智能的影響力很大程度上取決於所處環境和平台。他把AI比作人類的外部大腦——就像廚房是人類的外部消化器官,幫我們消化原本消化不了的食物,催生了農業、城市、文明變革,現在創造的AI也會有同樣深遠的影響,只是現在還無法完全預見。關於安全性,他的觀點反常識——開源比閉源更安全。陽光是最好的防護劑,更多人去審視一項技術的安全性、評估風險、迭代優化,本質上比一小撮人替所有人做安全決定要可靠得多。AI多樣性永遠比單一文化更安全,尤其在爭議最大的問題上,讓大家用不同方式探索遠比建圍牆花園自上而下規定什麼想法安全更穩妥。這不是新道理,人類已有幾百年信息自由的經驗。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。