KeyFrame內部研究專用

Gemini 3.6 Flash is Here But It's Not Great, Where's 3.5 PRO?

World of AI·7月21日週二·11 min英文

三句話摘要

Google DeepMind發佈Gemini 3.6 Flash和3.5 Flash Lite模型,速度與效率有提升,但性能未能追上主流frontier模型。 Google DeepMind以速度與效率作為賣點發佈3.6 Flash,但無法彌補frontier模型的性能落差,反映出Google在高端AI市場中的相對衰退。 策略轉向: Google放棄發佈預期的3.5 Pro,轉而優化Flash系列,反映出在frontier AI競賽中的落後狀態,可能被中文AI模型及OpenAI、Anthropic的領先優勢逼迫。

重點整理

重點
  • 1

    策略轉向: Google放棄發佈預期的3.5 Pro,轉而優化Flash系列,反映出在frontier AI競賽中的落後狀態,可能被中文AI模型及OpenAI、Anthropic的領先優勢逼迫。

  • 2

    效率優化的侷限: 雖然3.6 Flash在Token效率和長文本處理上有明顯改進,但這些改進只是使Flash模型更好用,無法彌補與frontier模型(Grok 4.5、GPT-5.6 Turbo)在代碼生成、軟體工程等核心任務上的性能鴻溝。

  • 3

    定價陷阱: 新模型標榜成本效率,但定價並未比GPT-5.6 Turbo便宜,Google自己的部落格對比竟然列出表現更好且更便宜的競品,這無疑削弱了自有產品的說服力。

  • 4

    Flash層級的內戰: 3.6 Flash成為Google最強模型(打敗自家3.1 Pro),卻仍不如其他廠商的Flash等級模型,代表Google已徹底放棄Pro版本的競爭,集中資源在cost-driven場景。

實用技巧與重點

乾貨
  • 新發佈模型:
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • 性能基準(Benchmark)數據:
  • 軟體工程:3.1 Pro 12% → 3.6 Flash 49%
  • 機器學習工程:3.1 Pro 42.6% → 3.5 Flash 49.7% → 3.6 Flash 63.9%
  • Knowledge Work:3.1 Pro 965 → 3.6 Flash 1421
  • Deep Software Engineering Token消耗:3.5 Flash 276 tokens → 3.6 Flash 97 tokens(減少65%)
  • Long Context Performance:77.3% → 91.8%
  • Chart Reasoning:3.5 Flash 84.2% vs 3.6 Flash 85.2%
  • Computer Use:領先
  • SVG生成:優秀
  • 定價對比:
  • Gemini 3.6 Flash:輸入$1.50、輸出$0.75
  • Gemini 3.5 Flash:輸入$1.50、輸出$9
  • GPT-5.6 Luna:比Gemini 3.6 Flash便宜
  • Grok 4.5:輸入更貴、輸出便宜$1.50、性能更好
  • Claude Sonnet:某些任務表現更好
  • 競爭模型性能對比(Software Engineering Bench Pro等):
  • Grok 4.5:軟體工程基準第一
  • GPT-5.6 Luna:深度軟體工程、終端基準領先
  • Claude Sonnet:機器學習基準、GDP Val領先
  • Gemini 3.6 Flash:均不是第一
  • 可用平台:
  • Google AI Studio
  • Gemini API

結論

結論

Google DeepMind以速度與效率作為賣點發佈3.6 Flash,但無法彌補frontier模型的性能落差,反映出Google在高端AI市場中的相對衰退。

完整解析

詳細

Google DeepMind在2026年七月發佈Gemini 3.6 Flash和3.5 Flash Lite兩款新模型。這次發佈最值得注意的是,Google並未如市場預期推出3.5 Pro版本,而是專注於Flash系列的優化升級。這一策略調整反映出Google在全球AI競爭中面臨的巨大壓力——中文AI模型正在取得領先,同時OpenAI與Anthropic的frontier模型也遠遠領先,Google因此決定轉向成本效率市場,試圖以快速與便宜的模型吸引價格敏感的用戶。

3.6 Flash相比之前版本的主要改進體現在兩個方面:速度與Token效率。在軟體工程基準測試中,3.6 Flash達到49%的得分,大幅超越3.1 Pro的12%;在機器學習工程領域,3.6 Flash獲得63.9%,明顯高於3.5 Flash的49.7%。最令人矚目的是Token效率提升——執行深度軟體工程任務時,從需要276個token減少到僅97個,降幅高達65%。此外,長文本理解能力從77.3%飆升至91.8%,這對需要處理冗長代碼或文檔的開發者而言是實質性的進步。圖表理解能力的提升也很穩定,3.5 Flash的84.2%提升至3.6 Flash的85.2%,雖然幅度不大,但SVG生成等視覺相關任務表現依舊優秀。

然而,當拿3.6 Flash與真正的frontier模型對比時,優勢蕩然無存。在Software Engineering Bench Pro這類核心基準上,Grok 4.5排名第一,GPT-5.6 Luna在深度軟體工程與終端基準表現更好,Claude Sonnet在機器學習基準上更具競爭力。定價方面也沒有帶來預期的驚喜——3.6 Flash的輸入價格保持在$1.50(與舊版相同),輸出價格從$9降至$0.75,但即便如此,仍然不如GPT-5.6 Luna與Grok 4.5便宜。最令人啼笑皆非的是,Google在官方部落格中列出的模型對比竟然包含了表現更好且更便宜的競品,這無異於自己給自己的產品判死刑。3.5 Pro的持續延期(原定六月推出,現已無期限推遲)暗示Google可能已經放棄該模型的開發,轉而集中資源在Flash層級,這代表Google在frontier AI競賽中的戰略潰退。

現階段,3.6 Flash對現有的Gemini用戶是個不錯的升級——更快、更便宜、長文本處理更好。但對於正在評估多家AI模型供應商的開發者而言,這次更新幾乎沒有改變任何選擇決策,因為Flash模型本身就不是用來與frontier模型競爭的。該模型已在Google AI Studio和Gemini API上線,大多數用戶應該能立即使用。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。