KeyFrame內部研究專用

GPT-5.6 Pro LEAKED + Mythos 5.1 Release [2 Big Updates]

AI That Works·6月22日週一·11 min英文

三句話摘要

GPT 5.6 即將發佈與 Anthropic 新旗艦模型的傳聞,以及兩者在實際生成能力上的對比分析。 GPT 5.6 在特定生成任務上有真實進步,但通用能力和長期自主工作尚未達到 Mythos 級別,而 Anthropic 可能同週推出新模型,使未來兩週成為 AI 領域最不確定的時期。 技術躍升的實質:GPT 5.6 的核心改進不在參數或推理預算,而是 Playwright 整合與瀏覽器自動化功能的加入。這意味著新模型不再是純文本生成器,而是被設計用於網頁自動化、測試和編碼等真實代理工作流,代表了功能層面的本質轉變。

重點整理

重點
  • 1

    技術躍升的實質:GPT 5.6 的核心改進不在參數或推理預算,而是 Playwright 整合與瀏覽器自動化功能的加入。這意味著新模型不再是純文本生成器,而是被設計用於網頁自動化、測試和編碼等真實代理工作流,代表了功能層面的本質轉變。

  • 2

    特定任務的突破,通用性的局限:GPT 5.6 在 3D Voxel 生成、SVG 代碼和遊戲原型上表現亮眼(如單個 HTML 檔案內實現完整的 Sims 模擬或 Minecraft 克隆),但在普遍設計提示下仍會調用過時套件,設計品味與 Opus 相比有明顯差距,這表明它是領域專家而非全能模型。

  • 3

    被高估的對標: 在特定任務上匹配或超越 Fable 5 不等於在全面工作流上達到同等水準。Fable 5 的核心優勢在於長期自主運作能力(可連續數小時自我驗證與完整項目管理),GPT 5.6 的洩露演示並未證明這一點,因此不應被視為完全的 Fable 替代品。

  • 4

    Anthropic 的戰略應對與不確定性:在 Fable 5 被政府下架的背景下,Anthropic 可能加速推出新型 Mythos(5.1 或 6)或 Claude Sonnet 5。這些信號來自模型 slug 和可信記者報導,但均未官方確認,實際發佈時間與能級仍是變數。

實用技巧與重點

乾貨
  • GPT 5.6 規格:推理預算 960(GPT 5.5 為 768)、知識截斷 2025 年 12 月、內置 Playwright + 瀏覽器功能
  • 預計發佈:2026 年 6 月 25 日(星期四);測試版本為 Kindle Alpha checkpoint
  • 生成演示具體數據
  • Voxel 火箭:30 分鐘生成,含發射機制、動態鏡頭、視效、程序音效
  • Sims 克隆:單 HTML 檔,含自主 AI、職業系統、關係互動、隨機事件、天氣循環
  • Minecraft 克隆:村莊、村民、多種怪物、火把光效、破壞動畫、可挖洞穴
  • Windows 11 SVG:精確度達 95% 以上,據稱超越 Fable 5
  • 能力排序:SVG 生成(GPT 5.6 > Fable 5)、3D Voxel(GPT 5.6 ≈ Fable 5)、設計品味(Opus > GPT 5.6)、長期自主(Fable 5 未被匹配)
  • Anthropic 傳聞信號:Claude Sonnet 5 slug 在合作商發現、新型 Mythos 從訓練完成、可能命名 Mythos 5.1 或 Mythos 6

結論

結論

GPT 5.6 在特定生成任務上有真實進步,但通用能力和長期自主工作尚未達到 Mythos 級別,而 Anthropic 可能同週推出新模型,使未來兩週成為 AI 領域最不確定的時期。

完整解析

詳細

這場發佈討論的背景是 OpenAI 的 GPT 5.6 已在 ChatGPT 內部進行大規模 A/B 測試。使用者只要升級至 Pro 版本、選擇 GPT 5.5 並輸入提示詞,就有機會體驗到該模型的 checkpoint 版本。官方未發表聲明,但洩露信息顯示發佈預計在 6 月 25 日進行,使用的是 Kindle Alpha checkpoint——據稱這不是 OpenAI 內部兩個候選版本中較強的一個。

從技術規格看,GPT 5.6 的推理預算(即模型思考和規劃的資源)從 768 提升至 960,知識截斷日期也從 8 月推進至 12 月。但更重要的是工具層面的改進:Playwright 的直接整合和內置瀏覽器自動化功能。這標誌著 GPT 5.6 被重新定位為代理工作流工具,而不僅是文本生成器,涵蓋網頁自動化、測試、研究和複雜編碼任務。

實際表現上,GPT 5.6 展現了令人印象深刻的生成能力,尤其在 3D 領域。它能在約 30 分鐘內生成一個完整的 Voxel 火箭,包括發射機制、動態追蹤攝影機、視效和程序生成音效——令人矚目的不是單一元素,而是視覺、物理、攝影機和音頻的整體協調感。更驚人的是遊戲原型生成:單個 HTML 檔案內實現的完整 Sims 模擬遊戲,具有自主 AI 角色、職業與收入系統、關係互動、隨機事件和動態天氣,所有系統同步運行。雖然不完美,但多系統交互的複雜度反映出模型在多組件構建上的能力。Minecraft 克隆也很強,包含村莊、村民、多種怪物、動態光效和可挖掘洞穴,僅在工藝系統上有所欠缺。在 SVG 代碼生成上,GPT 5.6 甚至被評為超越了 Fable 5,成功將 Windows 11 系統界面精確還原。

然而,這並不意味著 GPT 5.6 是 Fable 的完全替代品。前端設計上,新模型相比 GPT 5.5 有明顯進步,成功去除了舊版本那種通用的、容易識別的 GPT 風格,生成了具有強視覺層次、打磨 UI 和滾動效果的 SpaceX 克隆。但這些成功基於詳細具體的提示詞——在通用日常提示下,模型仍可能調用過時套件,輸出品質不足以稱為真正的 Mythos 級別。在純粹設計品味上,Opus 仍明顯領先。此外,GPT 5.6 的生成速度較慢,用戶在換取效率的同時需要承忍等待時間。最關鍵的是,儘管在特定任務上匹配或超越 Fable 5,GPT 5.6 尚未展示 Fable 5 的核心優勢:長期自主工作能力。Fable 5 可以連續數小時運行複雜項目、自我驗證並保持思路,這是它被視為「完全不同類別」的原因。

與此同時,Anthropic 也有重大動靜。在 Fable 5 因國家安全問題被政府下架的背景下,可信記者報導稱新的 Mythos 版本(可能是 Mythos 5.1 或 Mythos 6)或 Claude Sonnet 5 已從訓練完成。這些信號來自合作提供商上發現的模型 slug 和業內記者的報導,與今年 2 月 Sonnet 4.6 發佈前的徵兆相符。如果 Anthropic 無法迅速恢復 Fable 5,推出新的旗艦模型在戰略上是合理的。但關鍵是,這一切都未官方確認,不應被當作既定事實。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。