KeyFrame內部研究專用

Gemini 3.5 Pro's Entire Base Model SCRAPPED!

World of AI·7月4日週六·8 min英文

三句話摘要

OpenAI 即將推出 GPT-5.6 與 Claude Fable 5 競爭,Google DeepMind 延遲 Gemini 3.5 Pro 發布,各大模型因政府監管而加強安全防護。 下週模型大戰將重塑 AI 開發者的工具選擇,速率限制與安全防護的平衡,決定各家模型的實際影響力。 速率限制是關鍵競爭差異:Anthropic 模型儘管性能強但速率限制嚴格,限制實際應用廣度;OpenAI 歷來因基礎設施優勢提供更寬鬆額度,GPT-5.6 預期將沿襲此優勢,影響開發者採納。

重點整理

重點
  • 1

    速率限制是關鍵競爭差異:Anthropic 模型儘管性能強但速率限制嚴格,限制實際應用廣度;OpenAI 歷來因基礎設施優勢提供更寬鬆額度,GPT-5.6 預期將沿襲此優勢,影響開發者採納。

  • 2

    政府監管帶來強制安全防護:Llama 3.1 與 GPT-5.6 都因政府合作而內置激進防護機制,可能對提示詞造成限制,用戶初期使用時難以察覺,需逐步觀察實際影響。

  • 3

    Gemini 3.5 Pro 定位中端市場:延遲發布顯示 Google 寧願調整進度也不倉促上線,若能達到 Opus 4.8 與 GPT-5.5 水準,將吸引追求成本效益的用戶;但能否競爭頂級位置仍待觀察。

  • 4

    視覺生成領域 Google 展現優勢:Gemini 3.5 Pro 在 SVG 場景生成上已展現優於 Fable 5 的表現,Nanobanana Pro 基於新 3.5 Pro 基礎訓練,可能超越 GPT-4V,成為 Google 差異化競爭點。

實用技巧與重點

乾貨
  • GPT-5.6 發布時間:7 月 7 日或 9 日
  • Gemini 3.5 Pro 發布時間:7 月 17 日(延遲自原定 6 月)
  • Gemini 4 Flash:正在開發中
  • Nanobanana Pro:基於新 Gemini 3.5 Pro 基礎訓練
  • 當前最佳圖像模型:GPT-4V(講者個人體驗)
  • 政府監管應用模型:Claude Fable 5、GPT-5.6 均適用
  • 預期速率限制態勢:GPT-5.6 > Anthropic 模型(基於歷史模式)

結論

結論

下週模型大戰將重塑 AI 開發者的工具選擇,速率限制與安全防護的平衡,決定各家模型的實際影響力。

完整解析

詳細

下週對 AI 產業將是關鍵時刻。OpenAI 計劃在七月七日至九日推出 GPT-5.6,定位為與 Anthropic 的 Claude Fable 5 及 Llama 3.1 等競品直接對標的新一代旗艦模型。儘管 OpenAI 已公開過該模型的能力概況,但正式推出仍待到下週,屆時大眾才能真正獲得使用權限。

速率限制將是評估 GPT-5.6 商業可用性的關鍵因素。Anthropic 的 Fable 5 儘管性能強勁,卻因速率限制嚴格而限制了實際應用部署的廣度。根據歷史模式,OpenAI 因掌握更優越的基礎設施,通常能提供更寬鬆的使用配額,使其模型更易融入實際工作流程。這次 GPT-5.6 預期延續此優勢,儘管仍需實際驗證。

安全防護是另一重要面向。由於兩家公司皆與美國政府密切合作,且政府已表達關切,GPT-5.6 與 Fable 5 都將內置激進的安全防護機制。Anthropic 的部分防護涉及身份驗證,而 OpenAI 的具體措施目前不為人知,但可能同樣嚴苛。用戶初期可能察覺不到這些限制,唯有在持續使用中逐漸發現某些提示詞被阻止。

Google DeepMind 面臨的壓力更為直接。原定六月發布的 Gemini 3.5 Pro 已延遲至七月十七日,延遲原因在於模型需要更多預訓練時間。在 Anthropic 與 OpenAI 持續推進新模型、開源社群亦推出具競爭力模型的當下,若 Gemini 3.5 Pro 仍基於舊基礎訓練,將難以匹敵。延遲決策雖有損公關,卻是明智之舉。若最終能達到 Opus 4.8 與 GPT-5.5 的性能水準,Gemini 3.5 Pro 有望吸引尋求成本效益的開發者,成為市場的第三梯隊選項。此外,Nanobanana Pro 將基於新 Gemini 3.5 Pro 基礎訓練,有望在圖像生成領域超越當前業界最佳的 GPT-4V,為 Google 爭得一席之地。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。