KeyFrame內部研究專用

Gemini 4 Flash LEAKED and Fable 5 Already Has Rate Limit Issues!

World of AI·7月2日週四·8 min英文

三句話摘要

Google DeepMind推出Gemini 3.6 Flash新模型,而Anthropic的Fable 5重啟面臨嚴重的速率限制瓶頸。 最先進AI模型的推出已被基礎設施與速率限制的現實所制約,解決這一瓶頸將是未來所有AI實驗室面臨的首要挑戰。 Gemini 3.5 Pro的延遲發佈反映了監管與市場的雙重考量——美國政府安全審核機制可能造成延遲,但更可能是Google擔心新模型若無法超越Fable 5和GPT 5.6 Sole的表現,反而會傷害品牌聲譽,因此採取保守策略先行測試3.6 Flash。

重點整理

重點
  • 1

    Gemini 3.5 Pro的延遲發佈反映了監管與市場的雙重考量——美國政府安全審核機制可能造成延遲,但更可能是Google擔心新模型若無法超越Fable 5和GPT 5.6 Sole的表現,反而會傷害品牌聲譽,因此採取保守策略先行測試3.6 Flash。

  • 2

    Gemini 3.6 Flash在SVG代碼生成上確有進步,BMW M4 CS側視圖展現陰影效果與凝聚感,但PS5手柄仍存缺陷(按鈕懸浮問題),表明模型未達前沿水準,特別在思維推理與複雜編碼任務上不如競品。

  • 3

    Fable 5重啟後保持強能力,無安全削弱跡象,但核心問題是速率限制消耗極度低效——一個簡單提問竟消耗Pro計劃額度的2%,使大多數用戶無法實際應用於日常工作流程。

  • 4

    基礎設施瓶頸為行業共性困境:隨著Fable 5、GPT 5.6 Sole、傳言中的Mito 6等超強模型陸續推出,速率限制問題將持續惡化,唯有實驗室大幅擴充計算能力才能解決,否則最強模型將形同虛設。

實用技巧與重點

乾貨
  • 新模型
  • Gemini 3.6 Flash / Gemini 4 Flash(Google DeepMind,LMSYS Arena首次出現)
  • Fable 5 Max(Anthropic最高階版本)
  • 傳言中:Mito 6(早期測試階段)
  • 速率限制實測數據
  • Pro計劃配額:5小時使用額度
  • 測試提問:「Hello, the smartest LLM ever model is」
  • 消耗比例:單次提問消耗2%
  • 測試任務
  • Pelican騎自行車SVG生成
  • PS5手柄SVG生成(仍有懸浮按鈕缺陷)
  • BMW M4 CS側視圖SVG生成
  • 政府監管
  • 新型號需接受美國政府安全審核與批准
  • 實驗室需與政府協作建立安全規範
  • 競爭現狀
  • 市場領先模型:Fable 5、GPT 5.6 Sole
  • 當前年度Gemini發佈:僅Gemini 3.5 Flash
  • Gemini 3.5 Flash評價:Flash版本中不錯但非前沿模型

結論

結論

最先進AI模型的推出已被基礎設施與速率限制的現實所制約,解決這一瓶頸將是未來所有AI實驗室面臨的首要挑戰。

完整解析

詳細

Google DeepMind在近期呈現出謹慎的發佈策略。原本預期推出的Gemini 3.5 Pro至今未有動靜,反而是Gemini 3.6 Flash首次在LMSYS Arena測試競技場出現。講者分析了這一現象背後的兩種可能原因。首先,Gemini 3.5 Pro可能已開發完成但正接受美國政府的安全審核程序——因為按照當前規定,任何新型號模型都必須由實驗室與政府協作,確保建立足夠的安全措施與監管規範。其次,也是講者傾向認同的解釋,是市場競爭現實的考量。目前Fable 5和GPT 5.6 Sole已成為市場上最具競爭力的模型,倘若Gemini 3.5 Pro倉促推出卻表現不如這些競品,將直接傷害Google的品牌信譽。因此Google轉向先以3.6 Flash試市,藉此評估模型在實際應用中的表現,同時為最終的3.5 Pro發佈積累更充分的技術驗證。

從技術測試結果看,Gemini 3.6 Flash在SVG代碼生成能力上確實展現了進步。在Pelican騎自行車的測試中,模型輸出了更豐富的細節刻畫;BMW M4 CS側視圖的生成則加入了陰影效果與整體的視覺凝聚感,這些都是相較於過往Gemini系列的明顯改善。然而,PS5遊戲手柄的測試中仍出現問題,例如背面按鈕出現懸浮現象。這清楚地表明,新模型雖有進步但仍未達到前沿水準,特別在思維與推理能力上,距離Fable 5和GPT 5.6 Sole等競品還有顯著距離。這意味著Gemini 3.6 Flash難以成為開發者選擇用於複雜編碼工作的主力模型,而這正是市場所需要的。相比之下,上一代Gemini 3.5 Flash發佈時曾因優越的速度與效率而獲得廣泛應用,但這一代的競爭力明顯下滑。

在Anthropic方面,Fable 5已於近日重新上線提供服務。根據用戶反饋,模型的能力保持強勁,未出現被削弱的跡象,也未發現內建的追蹤或安全限制機制。然而,最嚴重的問題是其驚人低效的速率限制消耗。一位用戶在使用Fable 5 Max版本時,僅提出了一個簡單的問題——「hello, the smartest LLM ever model is」——卻消耗了Pro計劃5小時使用額度的2%。這不是個案,大量用戶都回報了類似的體驗。Anthropic官方雖建議用戶僅在最困難的任務中使用該模型以節省配額,但問題的根本原因在於基礎設施限制。目前Anthropic缺乏足夠的計算資源來以大規模、高效的方式服務Fable 5這樣的強大模型。隨著Fable 5、GPT 5.6 Sole乃至傳言中更強的Mito 6模型相繼推出,這一速率限制的瓶頸只會愈發嚴峻。除非各實驗室能夠大幅擴充其計算基礎設施與服務能力,否則這些頂級模型將難以被普通用戶實際應用於日常工作流程。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。