KeyFrame內部研究專用

GPT-5.6 Pro LEAKED & Is Coming Soon! Mythos 5 Level!

World of AI·6月20日週六·12 min英文

三句話摘要

OpenAI GPT 5.6 新旗艦模型能力展示與發布前洩露分析 GPT 5.6是OpenAI強勢回歸的標誌,推理能力提升與Playwright工具整合使其成為真正的遊戲改變者,多模態生成能力部分超越Fable 5,預示著AI模型的新高度。 推理能力量化升級:推理努力預算從768增至960,使模型能進行更長的思考鏈、更深入的規劃與更複雜的智能體任務處理。這是模型性能提升的量化證明。

重點整理

重點
  • 1

    推理能力量化升級:推理努力預算從768增至960,使模型能進行更長的思考鏈、更深入的規劃與更複雜的智能體任務處理。這是模型性能提升的量化證明。

  • 2

    工具生態完善:Playwright瀏覽器工具已內置ChatGPT,為網頁自動化、測試、研究和編碼任務提供原生支援。這填補了過去AI模型難以與web交互的空白。

  • 3

    代碼生成質量躍升:GPT 5.6能一次生成完整的Minecraft克隆遊戲、模擬遊戲等複雜系統,包含AI代理、職業系統、天氣變化等,相比GPT 5.5已消除許多通用UI風格。

  • 4

    多模態生成超預期:體素藝術、SVG代碼等領域表現優異,部分任務表現甚至超越Fable 5,展現出統一架構下的綜合能力提升。

實用技巧與重點

乾貨
  • 發布日期:6月25日
  • 推理能力值:960(GPT 5.5為768)
  • 知識截止:2025年12月(早前為2025年8月)
  • 檢查點版本:Kindle alpha、Kepler alpha(選用Kindle alpha)
  • 秘密測試方式:ChatGPT Pro選擇GPT 5.5 Pro時隨機獲得GPT 5.6測試版
  • Playwright工具:已集成到ChatGPT中
  • AssemblyAI語音API價格:4.5美元/小時(5分鐘通話約38元)
  • AssemblyAI功能:語音識別、LLM推理、語音生成、輪次檢測、工具呼叫、會話恢復
  • Universal 3 Pro技術:支持姓名、口音、賬號、確認碼等複雜信息
  • 輪次檢測:語音感知能力,區分停頓與完成說話

結論

結論

GPT 5.6是OpenAI強勢回歸的標誌,推理能力提升與Playwright工具整合使其成為真正的遊戲改變者,多模態生成能力部分超越Fable 5,預示著AI模型的新高度。

完整解析

詳細

OpenAI的新旗艦模型GPT 5.6即將於6月25日正式發布,此前已有大規模AB測試進行。目前有兩個檢查點版本——Kindle alpha和Kepler alpha,OpenAI選擇了相對較弱的Kindle alpha作為發布版本。有趣的是,某些ChatGPT Pro賬戶用戶已能進行秘密測試——當選擇GPT 5.5 Pro時,系統會隨機返回GPT 5.6測試版本,使部分用戶能夠抢先体驗。

從性能指標看,GPT 5.6 Pro的推理能力值達960,相比GPT 5.5的768有明顯提升。更強的推理能力意味著模型能進行更長的思考鏈、更深入的規劃,並處理更複雜的智能體任務。知識截止日期也從2025年8月推迟到12月,涵蓋更近期的信息。Playwright瀏覽器工具的集成是另一個關鍵進展,雖然瀏覽器使用功能尚未完全內置,但這為代理工作流程、網頁自動化和測試打開新可能性。

在代碼生成上,GPT 5.6取得重大突破。相比GPT 5.5已消除許多「GPT風格」的UI元素,生成的前端代碼品質顯著提升。測試表明,模型能生成帶有滾動觸發器和預期組件的精美用戶介面。更令人印象深刻的是,GPT 5.6能一次生成完整的Minecraft克隆遊戲,包括村民、各種生物、破損動畫、發光火炬、制作系統甚至洞穴系統。模型甚至能生成模擬遊戲,具有可自主活動的AI代理、多種職業、社交互動、天氣變化和隨機事件等高度複雜的系統。在體素藝術方面,模型能很好地生成不同3D空間,僅30分鐘內就能生成細節豐富的體素火箭,配備動態攝影機、視覺特效和程式生成音效。用SVG生成Windows 11操作系統時,GPT 5.6在組件準確性上甚至超越Fable 5。

與此同時,AssemblyAI推出的語音代理API簡化了傳統複雜的技術堆栈。過去需要四個不同服務——語音轉文本、LLM、文本轉語音、輪次檢測——如今整合為一個WebSocket連接。採用Universal 3 Pro流式技術可處理複雜信息如姓名、口音、賬號等。輪次檢測具備語音感知能力,能區分停頓和完成說話。定價為4.5美元/小時,5分鐘通話僅需38元,大幅降低開發者成本。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。