KeyFrame內部研究專用

Discovery Loop的愿景 | Jeff Dean | MoE | TensorFlow | 深度学习 | AI Agent | 递归式自我改进 | 科研自动化 | AI下个十年的方向

Best Partners TV·8月18日週二·16 min中文

三句話摘要

傑夫·迪恩的創業宣言:通過自動化加速科學發現本身,而非追求模型規模競賽。 傑夫·迪恩從Google二十七年的基礎研究經歷出發,創辦Discovery Loop的真正目標是自動化科學研發全流程本身,而不是單純追求大模型規模競賽。 MoE是容量與效率的突破性平衡——通過稀疏激活(只啟動必要的專家)實現大容量模型的低成本推理,類似人腦在不同任務激活不同區域,十倍效率提升代表了技術路線的根本轉變,而非普通優化。

重點整理

重點
  • 1

    MoE是容量與效率的突破性平衡——通過稀疏激活(只啟動必要的專家)實現大容量模型的低成本推理,類似人腦在不同任務激活不同區域,十倍效率提升代表了技術路線的根本轉變,而非普通優化。

  • 2

    開源框架的成功來自核心簡潔——TensorFlow普及深度學習的同時留下設計代價,靜態計算圖對部署有利但研究者不自然,contrib目錄的開放善意反而造成混亂;正確做法是保持核心穩定,讓實驗功能建立在上層。

  • 3

    研究直覺來自系統性的廣泛監測——不深耕單篇論文,而快速瀏覽百篇摘要理解領域全貌;通過第一原理和快速估算判斷技術可行性,這種能力來自持續練習而非天賦,讓你在複雜問題中發現已有的解決方向。

  • 4

    遞歸自我改進是全流程自動化,不只是模型自設計——從數據採集、模型結構、評測系統到結果分析,每個環節都能形成閉環優化,最終讓實驗速度從日/周級降至分鐘級,並能並行運行,甚至發現跨學科的隱藏聯繫。

實用技巧與重點

乾貨
  • MoE相比稠密模型訓練效率提升接近十倍
  • 論文標題:《規模極為龐大的神經網路:稀疏門控混合專家層》
  • DistBelief:Google內部系統,自動映射計算到CPU/GPU/集群
  • 演化Transformer相比標準版效率提升約百分之三十
  • 傑夫·迪恩在Google工作27年
  • 共同創辦人合作時間跨度14~30年
  • Discovery Loop採用公共利益公司(PBC)結構
  • 2017年ICLR會議參與者僅數百人,今日數萬人
  • Quoc Le推動神經架構搜尋(NAS)
  • 合著論文網站:ShapingAI(論文有獨立網站的唯一例外)
  • 聯合作者包括John Hennessy、James Manyika

結論

結論

傑夫·迪恩從Google二十七年的基礎研究經歷出發,創辦Discovery Loop的真正目標是自動化科學研發全流程本身,而不是單純追求大模型規模競賽。

完整解析

詳細

這場對談從2017年ICLR會議的一段私人回憶開始。當時宋曉冬團隊的論文獲得最佳論文獎,傑夫·迪恩上前祝賀,隨即興高采烈地介紹了剛完成的混合專家模型(MoE)研究。這個想法的初衷看似簡單:希望模型既有極大容量以學習更多資訊,又能保持運算效率。核心方案是讓模型內部擁有許多不同專家,每位專家各自擅長不同類型問題。訓練時模型逐漸學習每位專家的專長,推理時只需啟動最適合當前任務的少數專家。這樣既獲得整體的大容量,又避免承擔全部參數同步計算的成本。實驗結果顯示相比當時主流的稠密模型,MoE在訓練運算效率上帶來接近十倍的提升。傑夫·迪恩認為這代表了一個數量級的改進,預示了真正改變整個技術方向的重要突破。

宋曉冬接著問過去十多年AI發展最讓他意外的改變是什麼。他回憶2011~2012年左右開始認真研究如何把神經網路做得更大,發現單純擴大模型規模就能實現影像分類、語音識別等領域的顯著性能提升。這讓他們很早就意識到,深度學習將逐漸統一許多原本彼此獨立的研究方向——過去電腦視覺、語音辨識、自然語言處理各有一套獨立的技術體系和思考方式,而深度學習讓大家開始相信,只要擁有足夠的數據和運算能力,就可以直接從原始資料學習表示,無需依賴人為設計的規則和特徵工程。無論輸入是圖像、文字或語音,本質上都可視為一種學習問題。他判斷我們仍處於這個過程的中途,全世界在AI基礎設施上越來越大的投入本身就是一個訊號。

談到TensorFlow,傑夫·迪恩坦承了一些重要錯誤。早期TensorFlow採用靜態計算圖,雖然在效能和部署方面有優勢,但對研究者並非最自然的編程方式。後來PyTorch和JAX推動了即時執行的普及,TensorFlow自己也加入了這項能力。如果重新開始,他會更早採用這種更自然的執行方式。另一個不成功的決定是創建了contrib目錄,本意是希望更多外部開發者參與,結果反而越來越龐雜,同一功能出現五種、十種不同實現,社區反而困惑。他認為應該讓TensorFlow核心始終保持簡潔穩定,實驗性功能完全可以建立在核心之上而不是放進官方倉庫。整體而言TensorFlow完成了它最初的使命——推動全球研究者能使用同一套框架,讓研究真正可重現。

宋曉冬提出了一個更深層的問題:你如何判斷一個方向有長期價值,而另一個可能只是短期熱點?傑夫·迪恩的答案是持續廣泛監測許多不同方向,而不是只盯著自己正做的領域。他常對學生說,與其花很多時間精讀一篇論文,不如快速瀏覽十篇、甚至百篇論文摘要。真正重要的不是對單篇論文的深入理解,而是對整個領域的感知——腦子裡不斷累積正在發生的事,這裡有新的訓練方法,那裡有人提出新的模型結構,另一個方向新硬體開始可行。這些工作還不成熟,但共同構成一張不斷變化的地圖。當面對困難問題時,如果只盯著問題本身容易覺得無法解決,但腦子裡裝著領域全貌,你會發現原以為無解的七個問題中,其實已有五個方向開始出現輪廓。傑夫·迪恩也強調第一原理和快速估算的重要性——很多事情無需完整實現,先在腦子裡估算一遍,處理這麼多數據需要多久、傳輸成本是十秒鐘還是百年級,你就已經知道某條路線值不值得繼續走。

在AI安全話題上,宋曉冬分享了她的研究——他們建構了評估AI攻防能力的基準測試,最近實驗中AI智能體已能自主規劃一系列攻擊步驟,利用多個安全漏洞突破隔離環境建立跳板,最終訪問目標基礎設施。傑夫·迪恩的回應很平實:任何足夠強大的技術都可被用於不同目的,同一個模型可以幫助安全工程師修復漏洞,也可被攻擊者利用。關鍵是安全領域未來將變成雙方都擁有越來越強工具的持續競爭。他也強調一個被忽略的點:並非所有需要限制的行為都必須依靠技術解決,社會制度本身是解決方案的一部分。未經授權入侵本就違法,隨著AI能力增強,法律、監管與責任邊界都需要演進,這些往往是整個社會共同面對的問題。

對於遞歸式自我改進,傑夫·迪恩強調這不僅是讓模型自己設計模型,而是能否讓整個研發流程進入自動優化的循環。今天大型模型研發涉及許多環節:尋找更好的訓練數據、設計新的模型結構、建構評測體系、分析實驗結果決定下一輪調整。每一個環節都可形成自己的回饋循環,如果這些循環都逐漸自動化,整個研發效率就會大幅提升。他們曾做過演化Transformer的工作,不是重新發明Transformer,而是在已有組件基礎上通過演化算法嘗試新組合,最後得到效率提升約百分之三十的結構。Discovery Loop的願景是過去完成一次實驗需要一天、一週甚至一個月,未來希望許多實驗能在分鐘、小時內完成,同時並行運行成千上萬個實驗,再根據所有結果決定下一輪探索方向。有趣的是,模型可能沒有人類博士的學科限制,如果能同時理解多個領域,就更有機會發現不同學科間過去沒有建立的聯繫。

關於創業動力,傑夫·迪恩解釋小型專注團隊能擁有大型組織難以具備的專注度。如果整個團隊每天醒來只想著同一個問題,所有資源圍繞著同一件事,許多原本存在於大型組織的協調成本、溝通成本和不同目標的平衡就會自然消失。對Discovery Loop來說,唯一需要思考的就是怎樣真正加速科學發現,沒有第二個目標。他也強調雲計算發展改變了遊戲規則——過去創辦AI公司幾乎必須自己建造基礎設施,今天已不必要。成熟的雲端平台讓小型新創也能獲得世界級運算資源。但他不想因此否定大型公司,正因為Google提供了世界最好的工程團隊、運算平台和長期研發環境,他才能完成許多重要工作。大型公司擅長建置平台和基礎設施、長期研發投入,新創公司更容易圍繞明確問題快速前進。整個產業同時需要這兩種力量。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。