KeyFrame內部研究專用

Gemini 3.7 Flash 震驚發布,OpenAI 這次真的要完蛋了?

商業本質·8月16日週日·23 min中文

三句話摘要

Google Gemini 3.7 Flash 的推出標誌著 AI 競爭從「誰最聰明」轉向「誰能以更低成本完成更多實際工程工作」的時代轉變。 Gemini 3.7 Flash 最有價值的地方在於它沒有假裝用 AI 完全取代人,而是定位為「廉價、快速、願意反覆工作的執行者」,由人負責確定邊界與檢查結果,模型負責讀取、修改與嘗試——這個朴素敘事比「超級智能替代所有工作」更可能先改變市場。 AI 競爭軸轉移:過往模型競爭比拼極限題的正確率,現在轉向考量連續多步驟工作的完成能力與單位成本。一個任務可能經過幾十次推理和工具調用,單次價格若只高一點點,規模放大後就是另一筆帳單。3.7 Flash 的價值在於能否減少錯誤重試與修復次數,進而降低總體 token 消耗。

重點整理

重點
  • 1

    AI 競爭軸轉移:過往模型競爭比拼極限題的正確率,現在轉向考量連續多步驟工作的完成能力與單位成本。一個任務可能經過幾十次推理和工具調用,單次價格若只高一點點,規模放大後就是另一筆帳單。3.7 Flash 的價值在於能否減少錯誤重試與修復次數,進而降低總體 token 消耗。

  • 2

    從生成代碼到工程完成的能力躍進:傳統聊天模型的問題是「會寫不等於能寫完」——第一步看似正確,執行後卻暴露問題。3.7 Flash 改進的核心是能先讀取倉庫結構、決定需要修改的文件、運行測試、在失敗時調整策略。它強化了對字面指令的遵守,用戶要求只改一個組件時不會順手重構整個項目。

  • 3

    模型路由與分層架構的商業現實:成熟的代理系統不會固定使用一個模型,而是用 Flash 判斷普通任務直接執行,遇到複雜架構或高價值決策才轉交更強模型,最後用便宜模型檢查格式。Flash 爭奪的是路由系統裡呼叫最頻繁的位置——雖然負責最難的 5%,卻可能承包其餘 95% 的工作量,帶來的收入和開發者依賴超過單次銷售。

  • 4

    Google 生態的隱藏優勢與風險:Spark 能連接 Gmail、Google Calendar、Docs 等服務,天生掌握用戶郵件、文件、會議數據,這是 OpenAI 缺少的關鍵上下文。但優勢伴隨風險——一個代理讀取三封錯誤郵件若僅影響摘要還可接受,若擁有發信、修改日曆權限就會擴散到實際工作,需要完整的審計記錄與用戶確認機制。

實用技巧與重點

乾貨
  • 基準測試數據
  • Frontier Code 1.1 Main:34.4% → 43.6%
  • DeepSuite 1.1:48.8% → 65.3%
  • WebDev Arena:1538 → 1588
  • Terminal Bench 2.1:85.8%
  • Automation Bench:30.4%
  • OS World 2.0:33.8% → 47.9%
  • Terminal Bench 3.0:14.9%(對比 GPT-4o 的 20.8%)
  • 定價(2026-2027)
  • 推廣期(至 2026 年底):輸入 token $0.75/百萬,輸出 $3.75/百萬
  • 正式價格(2027 年 1 月起):輸入 $1.5/百萬,輸出 $7.5/百萬
  • 整合平台
  • Gemini API、AI Studio、Android Studio
  • Anti Gravity(開發環境)
  • 企業代理平台
  • Spark(個人全天候代理,連接 Gmail、Calendar、Docs)
  • 關鍵能力改進
  • 倉庫結構分析、選擇性文件讀取
  • 測試執行與失敗後策略調整
  • 遵守字面指令(不自動擴展需求)
  • 遇障礙時重新規劃與明確提問

結論

結論

Gemini 3.7 Flash 最有價值的地方在於它沒有假裝用 AI 完全取代人,而是定位為「廉價、快速、願意反覆工作的執行者」,由人負責確定邊界與檢查結果,模型負責讀取、修改與嘗試——這個朴素敘事比「超級智能替代所有工作」更可能先改變市場。

完整解析

詳細

Google 在短短三週內從 Gemini 3.6 Flash 推進到 3.7 版本,背後反映的不是技術突發,而是 AI 行業競爭邏輯的根本轉向。過去,模型公司比拼基準測試中的極限題——誰在最難的推理任務上得分最高。如今,Google 清晰地看到真實市場需求已經改變:企業不需要在每項任務上都用最聰明的模型,他們需要一個足夠聰慧、價格低廉、能夠連續執行幾十步工作的「工人」。

傳統編程模型的問題在於 「會寫不等於能寫完」。它可能生成看似正確的代碼片段,但遺漏依賴、誤讀文件結構、無意間破壞其他功能。用戶回報錯誤,模型再修一次,又製造新問題。整個任務陷入循環修復。3.7 Flash 的改進點在於把能力從「生成一段代碼」推進到「完成一項工程工作」。模型會先檢視倉庫結構,決定需要讀取哪些文件,修改後運行測試,失敗時調整策略。同時強化了對字面指令的遵守——用戶要求只改一個組件時,不會順手重構整套系統;需求不清楚時,更願意先提問而非自信推測。

電腦操作能力的進展(OS World 基準從 33.8% 升至 47.9%)表明 3.7 Flash 已接近半數情況下能正確執行屏幕交互任務。但 47.9% 的成功率意味著什麼?對於整理測試文件這類低風險操作尚可接受,但涉及支付、數據庫或生產環境修改則遠遠不夠。這恰好說明 Google 的策略成熟度:公司並未等待模型達到 100% 可靠性才部署代理,而是先將其放進可設定防線和回滾的環境——開發工具、企業代理平台、個人 Spark 都是讓模型在邊界內工作。真實軟體環境永遠在變化,按鈕位置不同、網頁會加載延遲、接口返回異常格式。代理如果只能執行預寫路線,它只是更昂貴的自動化腳本;它必須知道當前方法不行,決定是換工具、請求授權還是向用戶提問。

商業邏輯層面,3.7 Flash 代表著從「單次聰慧度」到「任務總成本」的轉變。假設模型 A 的輸入價格只有模型 B 一半,但 A 經常需要重試三次、多讀大量文件,最終可能比 B 更貴。而 B 單價雖高,卻能一次找對文件、正確調用工具、通過測試。開發者未來比較模型時,不會只看每百萬 token 多少錢,而是完成一項任務的總時間與總價格。推廣期每百萬輸入 token 0.75 美元相當激進,即便 2027 年恢復至 1.5 美元,仍瞄準高頻代理市場而非最昂貴的極限推理。Google 的定價有兩層目的:第一層是搶佔開發者心智——能力接近時,價格直接決定誰被設為默認選項,一旦開發者圍繞某個模型寫好提示詞與工具定義,遷移並非改個名字那麼簡單。第二層是搶奪任務量——聊天應用一天可能問幾十次,代理平台卻運行幾千次。誰拿下主力層,誰就掌控最大的 token 消耗量。旗艦模型負責展示能力上限,主力模型負責產生帳單。

Google 把 Spark 接入個人用戶的郵件、日曆、文檔,掌握了 OpenAI 缺少的關鍵上下文。但優勢伴隨風險——連接越深,權限越敏感。一個代理錯讀三封郵件可能只影響摘要不完整,若具有發信、修改日曆、共享文件的權限,錯誤就會擴散到真實工作。代理產品的成敗不只取決於模型能否執行,更取決於用戶敢否讓它執行。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。