KeyFrame內部研究專用

Google DeepMind Has a Very Big Problem!

World of AI·6月20日週六·9 min英文

三句話摘要

Google DeepMind在人才流失和模型落後的衝擊下陷入危機,而開源中文模型GLM 4智谱AI突然以十分之一的價格威脅業界,引發大模型競爭格局的急劇轉變。 當開源模型用十分之一的價格提供接近最佳水平的性能時,閉源商業模型的溢價空間開始被真正威脅,業界競爭已從「誰最強」變成「強到什麼程度才值這個價格」。 人才流失反映內部危機:Noam Shazir是Transformer原始論文八位作者之一,Google曾花27億美元收購他的Character.ai才招回他,如今他仍然選擇離開,說明Google無法提供他想要的。同週John Jumper也離開,他在AlphaFold獲得諾貝爾獎的成就後9年才決定離職,這類頂級人才的連續流出表示公司內部存在深層問題。

重點整理

重點
  • 1

    人才流失反映內部危機:Noam Shazir是Transformer原始論文八位作者之一,Google曾花27億美元收購他的Character.ai才招回他,如今他仍然選擇離開,說明Google無法提供他想要的。同週John Jumper也離開,他在AlphaFold獲得諾貝爾獎的成就後9年才決定離職,這類頂級人才的連續流出表示公司內部存在深層問題。

  • 2

    模型排名下滑是實質危機:Gemini最新版本在客觀評分中排名第五,不僅被OpenAI和Anthropic超越,還被中國開源模型智谱AI超越,特別是小模型Gemini Omni Flash被字節跳動的Sea Dance 2擊敗,顯示Google的技術已不再領先。

  • 3

    GLM 4的開源優勢正式威脅商業模式:從100萬token上下文、MIT許可無地區限制、到十分之一的價格,這個開源模型讓企業和開發者有了可行替代方案,開始迫使各大廠商重新評估定價與功能的價值比。

  • 4

    Gemini 3.5 Pro是決勝點:Google內部已在降低期望,但如果3.5 Pro能修復「懶惰問題」(在長複雜任務中途放棄),並實現承諾的視覺、多模態推理與代碼生成改進,將可能扭轉整個局面。

實用技巧與重點

乾貨
  • 人事變動:
  • Noam Shazir → OpenAI(Transformer共同作者、Gemini共同領導)
  • John Jumper → Anthropic(AlphaFold團隊領導者)
  • Character.ai收購價:27億美元(2020年代收購Noam Shazir公司)
  • Gemini排名與性能:
  • 目前排名:第五(Artificial Analysis智能指數)
  • Gemini 3.1 Pro發布時間:2024年2月
  • 競爭對手:Anthropic、OpenAI、智谱AI(Zhipu)
  • 待修復問題:長複雜任務的「懶惰問題」(Mid-task dropout)
  • Gemini 3.5 Pro預期:
  • 發布時間:6月30日前後
  • 改進方向:更強視覺、更好多模態推理、改進SVG/前端代碼生成、修復懶惰問題
  • 內部評價:已開始降低預期(「不是所需的step change」)
  • GLM 4(智谱AI)規格:
  • 上下文窗口:100萬tokens(前代200K,5倍提升)
  • 訓練特點:專門針對長期任務(多小時編碼、自動化研究、複雜除錯)
  • 推理模式:high/max可調
  • 編碼基準排名:三項困難多小時基準測試中排名第二,僅次於Claude Opus 4.8
  • 許可證:MIT、無地區限制
  • 定價:Anthropic高端版本的十分之一
  • 可用性:可下載權重本地運行
  • 內部引述:
  • 員工評論:「無法責備Noam離開,他不會是最後一個大牌」
  • 員工評論:「我們在文本、圖像、視頻、語音、視覺等方面都沒有frontier model」
  • Logan Kilpatrick(Gemini團隊):「團隊正在3.5 Pro上做大事」
  • Ethan Molek評論:「Flash很優秀,但需要好的frontier orchestrator在後面支撐」

結論

結論

當開源模型用十分之一的價格提供接近最佳水平的性能時,閉源商業模型的溢價空間開始被真正威脅,業界競爭已從「誰最強」變成「強到什麼程度才值這個價格」。

完整解析

詳細

Google DeepMind這一週經歷了多重打擊。首先是人才流失,Noam Shazir和John Jumper的離職不是簡單的職業轉換,而是業界頂級人物用實際行動投票表達對現狀的不滿。Noam是Transformer論文的八位共同作者之一,是這個時代所有大模型的理論基礎設計者。Google曾在Character.ai失利後花了27億美元才將他收購回來,卻仍無法留住他。John Jumper的AlphaFold工作獲得了諾貝爾獎,在Google工作9年後決定留職,他的離職更令人震驚,因為這不是在公司早期就跳槽的年輕人,而是投入深度、被認可度極高的科學家的理性決定。

內部言論透露了問題的嚴重性。員工直言Google已跌至第三甚至第四名,無法責備最優秀的人選擇離開,並預測會有更多人離職。這種內部士氣的下滑對公司長期發展的傷害往往比排名本身更大。在客觀評分上,Google的Gemini確實在Artificial Analysis智能指數排名第五,被OpenAI和Anthropic壓制,更扎心的是被中國的開源模型智谱AI超越。他們的小模型Gemini Omni Flash發布後反應平淡,甚至被字節跳動的Sea Dance 2輕鬆擊敗。

Google並非完全沒有翻身機會。定於6月30日前後發布的Gemini 3.5 Pro承載著重振信心的使命。根據流出的期望,新版本將強化視覺能力、多模態推理,改進代碼生成(特別是SVG和前端),最關鍵的是有希望修復之前版本在長複雜任務中的「懶惰問題」——用過Gemini的人都知道那個感受,模型會在任務進行到一半時選擇放棄。如果真的修復這個問題,將大幅改善日常使用體驗。Gemini團隊成員Logan Kilpatrick公開表示團隊在3.5 Pro上有信心,這至少說明內部還沒有完全放棄。歷史上Google認真起來往往能拿出業界最好的產品,Gemini 2.5和Gemini 3時代他們就曾從落後翻身成短暫領先。

然而同時,一股新力量悄悄改變了競爭格局。中國的智谱AI發布了GLM 4,這不僅是一個好模型,而是一個改變遊戲規則的存在。它將上下文窗口從200K tokens提升到100萬tokens,這個五倍的躍升對開源模型特別重要——開發者現在可以一次性餵給模型整個代碼庫,不再需要分段。GLM 4專門針對長期任務訓練,這意味著它能處理那些跨越數小時、包含數千個步驟的工作:大型代碼實現、自動化研究、複雜除錯。團隊甚至演示過早期版本在8小時內自主構建一個可運行的Linux桌面。在三項最困難的多小時編碼基準測試中,GLM 4排名第二,僅次於Anthropic的Claude Opus 4.8。

最具衝擊的是GLM 4的開源戰略。它採用MIT許可證,沒有地區限制,任何人都可以商業使用。同時付費版本的成本僅為Anthropic高端方案的十分之一。這意味著開發者面對的不再是非此即彼的選擇,而是真正的替代方案——一個開源、便宜、且在最困難任務上接近業界最佳的選項。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。