KeyFrame內部研究專用

Jeff Dean最新判断:AI的下一个拐点 | Google | TPU | AI芯片 | 大模型推理 | 上下文工程 | 创业机会 | 知识蒸馏 | 神经网络 | AI硬件 | 科学方法自动化

最佳拍档·8月9日週日·23 min中文

三句話摘要

傑夫·迪恩談 AI 能力邊界、硬體設計約束、以及創業者在 Agent 時代的機會選擇。 系統的效率邊界由最底層的物理約束決定,抓住那些被所有人遺忘的基本假設,往往比跟風最新趨勢更能開創新局。 AI 能力成長超過預期。 去年傑夫在 AI Ascent 預言 AI 達到初級工程師水平,一年過去驗證正確。但他低估了模型處理複雜任務的速度,特別是在 Agent 系統和長期運行任務上,進展比想像快得多。這不只發生在程式碼領域,其他科學和工程領域的 Agent 系統也開始真正發揮作用。

重點整理

重點
  • 1

    AI 能力成長超過預期。 去年傑夫在 AI Ascent 預言 AI 達到初級工程師水平,一年過去驗證正確。但他低估了模型處理複雜任務的速度,特別是在 Agent 系統和長期運行任務上,進展比想像快得多。這不只發生在程式碼領域,其他科學和工程領域的 Agent 系統也開始真正發揮作用。

  • 2

    自動化科學方法是 2027 的重點方向。 傑夫預測來年會看到機器學習系統本身的自動化,即系統透過跑大量實驗、自動拆分問題成子問題、進入緊密的實驗循環,最後自動整合結果來提升自己。這個思路不限於 ML,任何有可衡量目標的科學工程領域都能應用,一旦把實驗延遲壓低,效率提升會非常顯著。

  • 3

    硬體專用化才是效率提升的真正路徑。 就像 2001 年 Google 搜尋從硬碟移到記憶體是關鍵轉折,2026 年的轉折在推理硬體。因為 Agent 系統需要極低延遲,通用 GPU/TPU 的時代即將過去,高效能、低能耗的專用推理晶片將成為標配。延遲降低 50 倍會帶來系統級的革命。

  • 4

    數據搬運比計算貴 1000 倍,這重新定義了系統設計。 做一次計算只需 1 皮焦爾能量,但搬一次數據成本高 1000 倍。這個約束迫使工程師必須把數據打包成批處理,攤薄搬運成本。但追求極低延遲時,批量處理反而成為瓶頸,硬體的能量約束深刻影響著上層系統的每個選擇。

實用技巧與重點

乾貨
  • 數字與指標:
  • AI 能力水平:已達初級工程師水準
  • TPU 相較 CPU/GPU 的性能提升:能效高 30-80 倍,延遲低 20-30 倍
  • 數據搬運 vs 計算的能量比:1000:1
  • Jeff Dean 的思想實驗:電晶體錯誤率從每百萬年一次改為每天 20 次
  • 量子化學模擬加速:神經網路近似模擬器比 DFT 快 30 萬倍
  • 模型與工具:
  • Gemini Flash 模型(從 Pro 蒸餾出來)
  • AlphaChip(晶片佈局優化)
  • AlphaEvolve(提案→評估→保留循環)
  • Performance Hints 文檔(30 頁的效能優化指南)
  • Microbenchmark 庫(測試各種操作耗時)
  • 技術方法:
  • 知識蒸餾(Knowledge Distillation):大模型教小模型
  • Reed-Solomon 編碼(容錯機制)
  • MapReduce(分散運算框架)
  • 上下文工程(Retrieval + Tool Calling + Workflow 設計)
  • Multi-Agent 系統評估(多條路徑搜尋)
  • 創業判斷標準:
  • 避免選擇 20% 成功率的領域(通用模型會持續變好)
  • 優先選擇 0%-1% 成功率的領域(超出訓練分佈或需要專有數據)
  • 尋找三種機會:專有數據、專用模型、超難問題但有合適訓練數據

結論

結論

系統的效率邊界由最底層的物理約束決定,抓住那些被所有人遺忘的基本假設,往往比跟風最新趨勢更能開創新局。

完整解析

詳細

Jeff Dean 在 YC 創業學校的這場對話從 AI 能力邊界切入。去年他預言 AI 達到初級工程師水平,一年後驗證這個判斷基本正確,但他坦誠自己低估了進展速度。特別是在 Agent 系統和長期運行任務上,模型能力成長遠超預期。這意味著不只是程式碼寫作,從材料科學到藥物設計,Agent 系統都開始產生真實價值。

對於 2027 年的預測,Jeff 指向了「自動化科學方法」。他想像的是:系統自動提出實驗假設、自動執行、自動評估結果、自動反饋並改進。這個迴路的關鍵是把評估器做得夠快。他舉了十年前的例子,同事用神經網路近似量子化學模擬器,把耗時從一整夜降到午餐時間,讓整個實驗循環從月級別縮短到小時級別。一旦評估快了,就能跑 1000 倍的實驗,系統改進的速度會成指數級提升。

硬體設計是另一個高度濃縮的話題。Jeff 講述了 TPU 的起源:2013 年,Google 語音識別變得真正好用後,他算了個餐巾紙數學——如果每個用戶每天用 3 分鐘,整個伺服器叢集要翻倍。這個數字驅動了 TPU 的誕生。他強調,這不是為了某個特定演算法過度專用,而是為低精度、密集線性代數的通用需求設計。結果相較 CPU/GPU 能效高了 30-80 倍。如今他看到的下一波機會是推理硬體,因為 Agent 系統對極低延遲的需求和通用硬體不匹配。現場 6000 位創業者該盯著什麼?專用推理晶片。

最底層的約束是數據搬運。他提到一個對系統設計影響深遠的事實:計算一次數據只要 1 皮焦爾能量,但搬運它成本高 1000 倍。這個差異塑造了現代 ML 系統的每個選擇——為什麼要批量處理?因為可以攤薄搬運成本。但當你追求極低延遲時,批量處理的等待時間成為瓶頸。所以推理硬體的設計必須極度關注減少數據移動。

在系統設計層面,Jeff 強調「模型只是整個系統的一部分」。真正的目標是建立能解決具體問題的完整系統,包括工具調用、檢索增強、記憶、Agent 協調。訓練資料像大雜燴,但目前問題的上下文往往清晰得多。關鍵是讓模型理解有哪些工具可用、如何拆解問題、甚至嘗試多種方法並評估哪個有效。他自己的例子是,和同事寫了一個 skill 來自動化效能優化:模型學會了先跑 benchmark、改程式碼、再測,不斷迭代,相當於把人類工程師的工作流轉寫給模型。

對於創業方向的選擇,Jeff 給出了極具操作性的建議。第一步是選一個你超級興奮、對世界有用的問題。第二步是測試通用模型在這問題上的表現。如果完全失敗(0-1% 成功率),通常是好信號,表示超出訓練分佈。如果已經有 20% 成功率,未必是好信號,因為多一點資料和參數就會繼續變好。他列出三種值得做的機會:一是模型沒有的專有數據(如個人資訊),二是超難問題但訓練資料充分(如 AlphaFold),三是超出分佈的新問題類型。

長期 Agent 運行的挑戰也不能迴避。當 Agent 跑到第 30 步、第 40 步時往往開始跑偏。原因是離訓練分佈越遠,表現越差。應對方法有二:一是給模型更好的 skill 和 hint,讓它盡量走熟悉的路;二是用 multi-agent 系統,多條路徑平行搜尋,再用另一個評估器篩選可靠方案。Google 內部就維護了整套 harness 和 skill,定義得好就能顯著提升 Agent 實用性。

談到職業成長,Jeff 分享了知識蒸餾論文被 NIPS 拒絕的經歷。評審說「不太可能產生顯著影響」。但他們看到這是解決實際問題的關鍵,最後在 arXiv 上發布,整個業界用上了。現在 Gemini 的 Flash 模型正是這個思路的成功案例。教訓是:被拒絕也繼續幹下去。

最後是「品味」的話題。當所有人都在卷提示詞、學 Agent 用法時,Jeff 說最稀缺的能力其實是判斷什麼問題值得做。這來自經驗和思想實驗。他的練習方法是寫下未來 12 個月可能重要的事,一年後檢視哪些真的重要了,透過這種自我校準來訓練直覺。另一種方法是定期挑戰預設假設,就像當年預設是「晶片必須可靠」,他們卻問「如果晶體管每天出 20 次錯呢?」這類激進思想實驗,往往比守著現狀更能發現新方向。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。