Gemini 3.6 Flash is Here But It's Not Great, Where's 3.5 PRO?
三句話摘要
Google DeepMind發佈Gemini 3.6 Flash和3.5 Flash Lite模型,速度與效率有提升,但性能未能追上主流frontier模型。 Google DeepMind以速度與效率作為賣點發佈3.6 Flash,但無法彌補frontier模型的性能落差,反映出Google在高端AI市場中的相對衰退。 策略轉向: Google放棄發佈預期的3.5 Pro,轉而優化Flash系列,反映出在frontier AI競賽中的落後狀態,可能被中文AI模型及OpenAI、Anthropic的領先優勢逼迫。
重點整理
重點- 1
策略轉向: Google放棄發佈預期的3.5 Pro,轉而優化Flash系列,反映出在frontier AI競賽中的落後狀態,可能被中文AI模型及OpenAI、Anthropic的領先優勢逼迫。
- 2
效率優化的侷限: 雖然3.6 Flash在Token效率和長文本處理上有明顯改進,但這些改進只是使Flash模型更好用,無法彌補與frontier模型(Grok 4.5、GPT-5.6 Turbo)在代碼生成、軟體工程等核心任務上的性能鴻溝。
- 3
定價陷阱: 新模型標榜成本效率,但定價並未比GPT-5.6 Turbo便宜,Google自己的部落格對比竟然列出表現更好且更便宜的競品,這無疑削弱了自有產品的說服力。
- 4
Flash層級的內戰: 3.6 Flash成為Google最強模型(打敗自家3.1 Pro),卻仍不如其他廠商的Flash等級模型,代表Google已徹底放棄Pro版本的競爭,集中資源在cost-driven場景。
實用技巧與重點
乾貨- 新發佈模型:
- Gemini 3.6 Flash
- Gemini 3.5 Flash Lite
- 性能基準(Benchmark)數據:
- 軟體工程:3.1 Pro 12% → 3.6 Flash 49%
- 機器學習工程:3.1 Pro 42.6% → 3.5 Flash 49.7% → 3.6 Flash 63.9%
- Knowledge Work:3.1 Pro 965 → 3.6 Flash 1421
- Deep Software Engineering Token消耗:3.5 Flash 276 tokens → 3.6 Flash 97 tokens(減少65%)
- Long Context Performance:77.3% → 91.8%
- Chart Reasoning:3.5 Flash 84.2% vs 3.6 Flash 85.2%
- Computer Use:領先
- SVG生成:優秀
- 定價對比:
- Gemini 3.6 Flash:輸入$1.50、輸出$0.75
- Gemini 3.5 Flash:輸入$1.50、輸出$9
- GPT-5.6 Luna:比Gemini 3.6 Flash便宜
- Grok 4.5:輸入更貴、輸出便宜$1.50、性能更好
- Claude Sonnet:某些任務表現更好
- 競爭模型性能對比(Software Engineering Bench Pro等):
- Grok 4.5:軟體工程基準第一
- GPT-5.6 Luna:深度軟體工程、終端基準領先
- Claude Sonnet:機器學習基準、GDP Val領先
- Gemini 3.6 Flash:均不是第一
- 可用平台:
- Google AI Studio
- Gemini API
結論
結論“Google DeepMind以速度與效率作為賣點發佈3.6 Flash,但無法彌補frontier模型的性能落差,反映出Google在高端AI市場中的相對衰退。”
完整解析
詳細Google DeepMind在2026年七月發佈Gemini 3.6 Flash和3.5 Flash Lite兩款新模型。這次發佈最值得注意的是,Google並未如市場預期推出3.5 Pro版本,而是專注於Flash系列的優化升級。這一策略調整反映出Google在全球AI競爭中面臨的巨大壓力——中文AI模型正在取得領先,同時OpenAI與Anthropic的frontier模型也遠遠領先,Google因此決定轉向成本效率市場,試圖以快速與便宜的模型吸引價格敏感的用戶。
3.6 Flash相比之前版本的主要改進體現在兩個方面:速度與Token效率。在軟體工程基準測試中,3.6 Flash達到49%的得分,大幅超越3.1 Pro的12%;在機器學習工程領域,3.6 Flash獲得63.9%,明顯高於3.5 Flash的49.7%。最令人矚目的是Token效率提升——執行深度軟體工程任務時,從需要276個token減少到僅97個,降幅高達65%。此外,長文本理解能力從77.3%飆升至91.8%,這對需要處理冗長代碼或文檔的開發者而言是實質性的進步。圖表理解能力的提升也很穩定,3.5 Flash的84.2%提升至3.6 Flash的85.2%,雖然幅度不大,但SVG生成等視覺相關任務表現依舊優秀。
然而,當拿3.6 Flash與真正的frontier模型對比時,優勢蕩然無存。在Software Engineering Bench Pro這類核心基準上,Grok 4.5排名第一,GPT-5.6 Luna在深度軟體工程與終端基準表現更好,Claude Sonnet在機器學習基準上更具競爭力。定價方面也沒有帶來預期的驚喜——3.6 Flash的輸入價格保持在$1.50(與舊版相同),輸出價格從$9降至$0.75,但即便如此,仍然不如GPT-5.6 Luna與Grok 4.5便宜。最令人啼笑皆非的是,Google在官方部落格中列出的模型對比竟然包含了表現更好且更便宜的競品,這無異於自己給自己的產品判死刑。3.5 Pro的持續延期(原定六月推出,現已無期限推遲)暗示Google可能已經放棄該模型的開發,轉而集中資源在Flash層級,這代表Google在frontier AI競賽中的戰略潰退。
現階段,3.6 Flash對現有的Gemini用戶是個不錯的升級——更快、更便宜、長文本處理更好。但對於正在評估多家AI模型供應商的開發者而言,這次更新幾乎沒有改變任何選擇決策,因為Flash模型本身就不是用來與frontier模型競爭的。該模型已在Google AI Studio和Gemini API上線,大多數用戶應該能立即使用。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


