Jeff Dean最新判断:AI的下一个拐点 | Google | TPU | AI芯片 | 大模型推理 | 上下文工程 | 创业机会 | 知识蒸馏 | 神经网络 | AI硬件 | 科学方法自动化
三句話摘要
傑夫·迪恩談 AI 能力邊界、硬體設計約束、以及創業者在 Agent 時代的機會選擇。 系統的效率邊界由最底層的物理約束決定,抓住那些被所有人遺忘的基本假設,往往比跟風最新趨勢更能開創新局。 AI 能力成長超過預期。 去年傑夫在 AI Ascent 預言 AI 達到初級工程師水平,一年過去驗證正確。但他低估了模型處理複雜任務的速度,特別是在 Agent 系統和長期運行任務上,進展比想像快得多。這不只發生在程式碼領域,其他科學和工程領域的 Agent 系統也開始真正發揮作用。
重點整理
重點- 1
AI 能力成長超過預期。 去年傑夫在 AI Ascent 預言 AI 達到初級工程師水平,一年過去驗證正確。但他低估了模型處理複雜任務的速度,特別是在 Agent 系統和長期運行任務上,進展比想像快得多。這不只發生在程式碼領域,其他科學和工程領域的 Agent 系統也開始真正發揮作用。
- 2
自動化科學方法是 2027 的重點方向。 傑夫預測來年會看到機器學習系統本身的自動化,即系統透過跑大量實驗、自動拆分問題成子問題、進入緊密的實驗循環,最後自動整合結果來提升自己。這個思路不限於 ML,任何有可衡量目標的科學工程領域都能應用,一旦把實驗延遲壓低,效率提升會非常顯著。
- 3
硬體專用化才是效率提升的真正路徑。 就像 2001 年 Google 搜尋從硬碟移到記憶體是關鍵轉折,2026 年的轉折在推理硬體。因為 Agent 系統需要極低延遲,通用 GPU/TPU 的時代即將過去,高效能、低能耗的專用推理晶片將成為標配。延遲降低 50 倍會帶來系統級的革命。
- 4
數據搬運比計算貴 1000 倍,這重新定義了系統設計。 做一次計算只需 1 皮焦爾能量,但搬一次數據成本高 1000 倍。這個約束迫使工程師必須把數據打包成批處理,攤薄搬運成本。但追求極低延遲時,批量處理反而成為瓶頸,硬體的能量約束深刻影響著上層系統的每個選擇。
實用技巧與重點
乾貨- 數字與指標:
- AI 能力水平:已達初級工程師水準
- TPU 相較 CPU/GPU 的性能提升:能效高 30-80 倍,延遲低 20-30 倍
- 數據搬運 vs 計算的能量比:1000:1
- Jeff Dean 的思想實驗:電晶體錯誤率從每百萬年一次改為每天 20 次
- 量子化學模擬加速:神經網路近似模擬器比 DFT 快 30 萬倍
- 模型與工具:
- Gemini Flash 模型(從 Pro 蒸餾出來)
- AlphaChip(晶片佈局優化)
- AlphaEvolve(提案→評估→保留循環)
- Performance Hints 文檔(30 頁的效能優化指南)
- Microbenchmark 庫(測試各種操作耗時)
- 技術方法:
- 知識蒸餾(Knowledge Distillation):大模型教小模型
- Reed-Solomon 編碼(容錯機制)
- MapReduce(分散運算框架)
- 上下文工程(Retrieval + Tool Calling + Workflow 設計)
- Multi-Agent 系統評估(多條路徑搜尋)
- 創業判斷標準:
- 避免選擇 20% 成功率的領域(通用模型會持續變好)
- 優先選擇 0%-1% 成功率的領域(超出訓練分佈或需要專有數據)
- 尋找三種機會:專有數據、專用模型、超難問題但有合適訓練數據
結論
結論“系統的效率邊界由最底層的物理約束決定,抓住那些被所有人遺忘的基本假設,往往比跟風最新趨勢更能開創新局。”
完整解析
詳細Jeff Dean 在 YC 創業學校的這場對話從 AI 能力邊界切入。去年他預言 AI 達到初級工程師水平,一年後驗證這個判斷基本正確,但他坦誠自己低估了進展速度。特別是在 Agent 系統和長期運行任務上,模型能力成長遠超預期。這意味著不只是程式碼寫作,從材料科學到藥物設計,Agent 系統都開始產生真實價值。
對於 2027 年的預測,Jeff 指向了「自動化科學方法」。他想像的是:系統自動提出實驗假設、自動執行、自動評估結果、自動反饋並改進。這個迴路的關鍵是把評估器做得夠快。他舉了十年前的例子,同事用神經網路近似量子化學模擬器,把耗時從一整夜降到午餐時間,讓整個實驗循環從月級別縮短到小時級別。一旦評估快了,就能跑 1000 倍的實驗,系統改進的速度會成指數級提升。
硬體設計是另一個高度濃縮的話題。Jeff 講述了 TPU 的起源:2013 年,Google 語音識別變得真正好用後,他算了個餐巾紙數學——如果每個用戶每天用 3 分鐘,整個伺服器叢集要翻倍。這個數字驅動了 TPU 的誕生。他強調,這不是為了某個特定演算法過度專用,而是為低精度、密集線性代數的通用需求設計。結果相較 CPU/GPU 能效高了 30-80 倍。如今他看到的下一波機會是推理硬體,因為 Agent 系統對極低延遲的需求和通用硬體不匹配。現場 6000 位創業者該盯著什麼?專用推理晶片。
最底層的約束是數據搬運。他提到一個對系統設計影響深遠的事實:計算一次數據只要 1 皮焦爾能量,但搬運它成本高 1000 倍。這個差異塑造了現代 ML 系統的每個選擇——為什麼要批量處理?因為可以攤薄搬運成本。但當你追求極低延遲時,批量處理的等待時間成為瓶頸。所以推理硬體的設計必須極度關注減少數據移動。
在系統設計層面,Jeff 強調「模型只是整個系統的一部分」。真正的目標是建立能解決具體問題的完整系統,包括工具調用、檢索增強、記憶、Agent 協調。訓練資料像大雜燴,但目前問題的上下文往往清晰得多。關鍵是讓模型理解有哪些工具可用、如何拆解問題、甚至嘗試多種方法並評估哪個有效。他自己的例子是,和同事寫了一個 skill 來自動化效能優化:模型學會了先跑 benchmark、改程式碼、再測,不斷迭代,相當於把人類工程師的工作流轉寫給模型。
對於創業方向的選擇,Jeff 給出了極具操作性的建議。第一步是選一個你超級興奮、對世界有用的問題。第二步是測試通用模型在這問題上的表現。如果完全失敗(0-1% 成功率),通常是好信號,表示超出訓練分佈。如果已經有 20% 成功率,未必是好信號,因為多一點資料和參數就會繼續變好。他列出三種值得做的機會:一是模型沒有的專有數據(如個人資訊),二是超難問題但訓練資料充分(如 AlphaFold),三是超出分佈的新問題類型。
長期 Agent 運行的挑戰也不能迴避。當 Agent 跑到第 30 步、第 40 步時往往開始跑偏。原因是離訓練分佈越遠,表現越差。應對方法有二:一是給模型更好的 skill 和 hint,讓它盡量走熟悉的路;二是用 multi-agent 系統,多條路徑平行搜尋,再用另一個評估器篩選可靠方案。Google 內部就維護了整套 harness 和 skill,定義得好就能顯著提升 Agent 實用性。
談到職業成長,Jeff 分享了知識蒸餾論文被 NIPS 拒絕的經歷。評審說「不太可能產生顯著影響」。但他們看到這是解決實際問題的關鍵,最後在 arXiv 上發布,整個業界用上了。現在 Gemini 的 Flash 模型正是這個思路的成功案例。教訓是:被拒絕也繼續幹下去。
最後是「品味」的話題。當所有人都在卷提示詞、學 Agent 用法時,Jeff 說最稀缺的能力其實是判斷什麼問題值得做。這來自經驗和思想實驗。他的練習方法是寫下未來 12 個月可能重要的事,一年後檢視哪些真的重要了,透過這種自我校準來訓練直覺。另一種方法是定期挑戰預設假設,就像當年預設是「晶片必須可靠」,他們卻問「如果晶體管每天出 20 次錯呢?」這類激進思想實驗,往往比守著現狀更能發現新方向。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


