KeyFrame內部研究專用

Gemini 4 Flash SOON, Fable 5 is Back, GPT-5.6 Codex Update, Seed Dance 2.5, & More! AI NEWS

WorldofAI·7月1日週三·17 min英文

三句話摘要

七月首週 AI 產業綜合動態:涵蓋 Claude Fable 5 全球重新部署、Google Gemini 新版本升級、OpenAI GPT-5.6 洩露細節及人型機器人邁入實際生產的重要新聞。 --- Claude Fable 5 的受管制重新部署、多家頭部公司密集發佈新模型及人型機器人進入真實生產環境,共同標誌著 AI 產業正從高速技術競賽階段轉向「安全監管+實際應用」的新常態。 Claude Fable 5 重新部署的多層配套措施:經三週離線後,Anthropic 與美國政府的建設性討論促成恢復。公司新增網安分類器以檢測危險請求,並與亞馬遜、微軟等合作建立行業框架評估 AI 越獄。同時導入分層定價與信用系統,Pro/Teams 用戶至 7 月 7 日前享 50% 週配額。

重點整理

重點
  • 1

    Claude Fable 5 重新部署的多層配套措施:經三週離線後,Anthropic 與美國政府的建設性討論促成恢復。公司新增網安分類器以檢測危險請求,並與亞馬遜、微軟等合作建立行業框架評估 AI 越獄。同時導入分層定價與信用系統,Pro/Teams 用戶至 7 月 7 日前享 50% 週配額。

  • 2

    Fable 5 品質與成本權衡:在 HTML5 物理演示測試中,Fable 5 耗資 $3(62k tokens)全場景評分達 8+,雖成本是 Opus 4.8 的六倍,但輸出品質遠優,並展示單提示內生成完整遊戲程式碼與程序生成 3D 資產的能力。

  • 3

    Google Gemini Flash 的穩健升級:新檢查點在 Arena 上表現明顯優於現有版本,特別在 SVG 生成上精度高、細節豐富,雖未確認最終版本號(可能為 3.6 或 4 Flash),但被視為對近期批評的積極回應。

  • 4

    機器人進入真實生產環節:Figure 03 已在寶馬工廠部署執行物流與製造任務,Figure AI 估值在 28 個月內從 5 億躍至 39 億美元,標誌著 AI 機器人從展示原型轉向實際應用的里程碑。

  • 5

    --

實用技巧與重點

乾貨
  • Claude Fable 5
  • 全球重新上線時間:2026 年 7 月 2 日起
  • 涵蓋平台:Claude AI、Claude API、Claude Code、Claude Co-Works
  • Pro/Teams 用戶配額:50% 週使用限額(至 2026/7/7),後轉向信用系統
  • 新安全措施:網安分類器、行業越獄評估框架、政府預發佈測試合作
  • 效能對比(HTML5 物理演示任務)
  • Claude Fable 5:62k tokens、$3、8+ 分(所有場景)
  • GPT-5.5:37k tokens、$1、8+ 分(部分場景)
  • Claude Opus 4.8:22k tokens、$0.5、7+ 分
  • GLM 5.2:36k tokens、$0.08、6+ 分
  • Google 新模型
  • Gemini Nano Light:圖像生成,最新、最快、最便宜
  • Gemini Omni Flash:10 秒影片生成耗時 31 秒、成本 $1.32
  • 競品動態
  • GPT-5.6 Codex:傳聞上下文視窗 372k tokens(未官方確認)
  • C-Dance 2.5:預計 2 週內在中國推出,支持 30 秒單鏡頭原生影片
  • Z-Code IDE 3.0:基於 GLM 5.2 的原生 AI 編碼環境,支持 Linux/Windows/macOS
  • XAI Voice Agent Builder:無代碼語音代理平台,成本 5 美分/分鐘
  • Figure AI 機器人
  • Figure 03 部署地點:寶馬工廠(真實物流與製造任務)
  • 公司估值:5 億美元(28 個月前)→ 39 億美元(目前)
  • --

結論

結論

Claude Fable 5 的受管制重新部署、多家頭部公司密集發佈新模型及人型機器人進入真實生產環境,共同標誌著 AI 產業正從高速技術競賽階段轉向「安全監管+實際應用」的新常態。

完整解析

詳細

七月首週見證了 AI 產業從強制中斷向新秩序過渡的關鍵時刻。Claude Fable 5 在經歷三週的全球下線後正式回歸。這次重新部署並非簡單恢復原狀,而是在美國政府與 Anthropic 的建設性對話基礎上的結構性升級。公司導入了新的網安分類器體系,用於實時偵測和阻止危險請求,但考慮到該系統仍在優化階段,部分常規編碼與除錯任務在誤檢風險消除前可能暫時回退至 Claude Opus 4.8。此外,Anthropic 正式宣布與亞馬遜、微軟和其他玻璃翼合作夥伴建立共享的行業評估框架,聯手應對 AI 越獄問題,同時深化與美國政府在預發佈模型測試、越獄情報分享及 AI 安全研究等方面的協作。

效能測試揭示了 Fable 5 依然保持頂級競爭力。AtomicChat 在 HTML5 物理演示基準測試中發現,Fable 5 用 62,000 tokens、耗資 3 美元,在所有生成場景中都獲得 8 分以上,特別是在物理碰撞擬真、物件摧毀效果和無浮現或裁剪問題方面表現卓越。雖然成本是 Opus 4.8 的六倍,但品質差距正當了這一溢價。最令人印象深刻的是有開發者成功在單個提示內要求 Fable 5 重現 GTA 6,結果 Fable 5 不僅輸出完整遊戲程式碼,還透過程序生成的方式產出了所有 3D 資產,完全無需外部模型或預製素材。

Google 方面則透過推出升級的 Gemini Flash 檢查點作出有力回應。雖然官方版本號尚未公開(代號提示可能為 Gemini 3.6 Flash 或 Gemini 4 Flash),但 Arena 上的測試結果表明其效能明顯超越現有 Flash 模型。這次升級被定性為「穩健的增量改進」而非代際躍升,在 SVG 生成領域表現尤其突出,能夠生成細節豐富、構圖精確的向量圖形。同時,Google DeepMind 還推出了 Gemini Nano Light(面向規模化圖像生成的輕量版本)與 Gemini Omni Flash(專門用於影片生成與編輯的新模型)。其中 Omni Flash 能在 31 秒內生成 10 秒影片、成本僅 1.32 美元,雖然品質仍需改進,但在速度與成本方面建立了新的基準。

OpenAI 的消息相對複雜。根據洩露的 GitHub 提交資訊,GPT-5.6 Codex 的上下文視窗可能僅為 372,000 tokens,遠低於業界普遍期待的 100 萬 token 級別,這一差距引發了對模型能力的質疑,但 OpenAI 尚未官方確認。在中國市場,BiteDance 正準備在兩週內推出 C-Dance 2.5,據稱將支持 30 秒單鏡頭原生影片生成,以及大幅提升素材參考容量和影片生成控制能力。若屬實,這將對標目前影片生成領域的核心痛點——單鏡頭長度限制與精細控制的缺乏。此外,基於 GLM 系列模型的 Z-Code IDE 3.0 正式推出,作為一款原生 AI 編碼環境,支持跨 Linux、Windows、macOS 平台的通用軟體開發全流程自動化。

在體現商業化潛力的領域,Figure AI 的人型機器人 Figure 03 已開始進駐寶馬工廠執行真實的物流與製造任務。這一步伐標誌著 AI 機器人從實驗室原型與公開演示正式邁入生產環節,是實現商業價值的關鍵里程碑。該公司的估值在過去 28 個月內從 5 億美元飆升至 39 億美元,增幅達 680%,充分反映了市場對具體應用潛力的認可。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。