KeyFrame內部研究專用

OpenAI's GPT-5.6 Pro Is Coming. Can It Beat Fable 5?

World of AI·6月18日週四·9 min英文

三句話摘要

OpenAI 正在測試新模型 GPT 5.6 Pro,計畫下週四發布,性能接近或部分超越 Fable 5。 GPT 5.6 Pro 在推理與代碼生成上性能接近 Fable 5,代表 OpenAI 在 AI 模型競爭中的重大進展。 GPT 5.6 Pro 在 SVG 與 3D 代碼生成方面相比前代大幅進步,能生成 BMW 矢量圖、KUKA 機器人仿真等複雜圖形,展現視覺編碼理解能力顯著提升。

重點整理

重點
  • 1

    GPT 5.6 Pro 在 SVG 與 3D 代碼生成方面相比前代大幅進步,能生成 BMW 矢量圖、KUKA 機器人仿真等複雜圖形,展現視覺編碼理解能力顯著提升。

  • 2

    推理與邏輯能力是該模型的強項,特別是 3.js 與複雜編碼任務表現優異,這符合 OpenAI 一貫的研發優先順序,用於強化 Codex 工作流的推理基礎。

  • 3

    前端 Web 開發仍是短板,複雜前端任務表現略低於 Fable 5,但已相比 GPT 5.5 改進,反映出 OpenAI 在此方向的投入相對有限。

  • 4

    生成效率需優化,特定任務耗時 20-40 分鐘可能源於思維能力增強的代價,實際發布版本性能預期會改善。

實用技巧與重點

乾貨
  • 預期發布時間:下週四
  • 訪問方式:ChatGPT 5.5 Pro 選項下測試版
  • 測試案例結果:
  • BMW SVG:GPT 5.6 Pro 接近 Fable 5 高端模式,Fable 5 略勝
  • 雪城 SVG:GPT 5.6 Pro 創意更佳,Fable 5 建築更清晰
  • KUKA 機器人 3D 仿真:GPT 5.6 Pro 優於 Fable 5
  • 3.js Web 場景:GPT 5.6 Pro 包含陰影細節,勝過 Fable 5
  • Windows 11 SVG:GPT 5.6 Pro 更優但含多餘元素
  • 弓箭遊戲仿真:略低於 Fable 5,優於 GPT 5.5
  • 單次生成耗時:20-40 分鐘(複雜任務)
  • 推理能力:相比 5.5 大幅改進
  • 前端開發能力:未達 Fable 5 水準
  • Newsletter 平台:universeofai.bihive.com
  • 頻道:World of AI(YouTube)、Universe of AI(X)

結論

結論

GPT 5.6 Pro 在推理與代碼生成上性能接近 Fable 5,代表 OpenAI 在 AI 模型競爭中的重大進展。

完整解析

詳細

OpenAI 正在秘密測試新模型 GPT 5.6 Pro,預計最快下週四發布。原本這次發布可能受 Fable 5 消息影響而延遲,但經過 OpenAI、Anthropic 與美國政府官員的會議後,情勢出現轉機,Fable 5 也有望很快重新上線。目前測試者已能在 ChatGPT 5.5 Pro 的介面下體驗 GPT 5.6 Pro 的早期版本。

從外洩的測試結果來看,GPT 5.6 Pro 展現出多面向的顯著改進。在 SVG 代碼生成方面,模型能處理複雜圖形任務,如精細的 BMW 矢量圖繪製,這在幾個月前仍是困難的挑戰。雖然不總是超越 Fable 5,但已相當接近。在雪城 SVG 測試中,GPT 5.6 Pro 的創意表現突出,能生成北極光等想像力十足的元素,儘管清晰度略遜一籌。

最令人矚目的是 3D 與互動 Web 能力的突破。模型成功生成包含多個可切換設定的 KUKA 機器人完整 3D 仿真,這是 OpenAI 首次展現此等能力。3.js 生成同樣亮眼,模型創建出含陰影、光影細節的複雜場景,在某些測試中甚至超越 Fable 5。然而,前端 Web 開發仍是相對弱點。雖相比 GPT 5.5 已改進,但在複雜前端任務上仍略遜 Fable 5,例如遊戲仿真的生成品質就低於預期。

這反映出 OpenAI 的策略重點:優先強化推理與後端編碼能力,因這些將整合進 Codex 工作流,對開發者工具至關重要。值得注意的是,某些複雜任務耗時 20-40 分鐘,可能是思維能力增強帶來的代價,但實際發布版本的效能應會改善。總體而言,GPT 5.6 Pro 已在多個維度接近 Fable 5 的水準,標誌著 OpenAI 正逐步縮小與競爭對手的差距。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。