KeyFrame內部研究專用

Where Is GPT 5.6? Meanwhile GLM 5.2 Just Beat GPT 5.5

World of AI·6月17日週三·9 min英文

三句話摘要

政府監管加劇改變 AI 格局,OpenAI GPT 5.6 面臨延遲風險,開源模型 GLM 5.2 性能突破成為替代選項。 監管限制推動了 AI 應用策略的根本性轉變——從全球雲端模型依賴轉向本地開源自主部署,開源社群的技術突破使這個轉變變得可行且高效。 政府監管成為新常態:美國政府首次主動限制 AI 模型,導致 Anthropic 關閉 Fable 5 全球訪問,限期至 2026 年 6 月 22 日。OpenAI 正與政府協調 GPT 5.6 發布條件,可能實施身份驗證、政府 ID、自拍視頻等確認程序,未來跨境訪問面臨重大障礙。

重點整理

重點
  • 1

    政府監管成為新常態:美國政府首次主動限制 AI 模型,導致 Anthropic 關閉 Fable 5 全球訪問,限期至 2026 年 6 月 22 日。OpenAI 正與政府協調 GPT 5.6 發布條件,可能實施身份驗證、政府 ID、自拍視頻等確認程序,未來跨境訪問面臨重大障礙。

  • 2

    GPT 5.6 定位調整與上市策略:不同於 Fable 5 的激進性能躍升,GPT 5.6 定位為漸進升級,在編碼與推理能力有所提升但不會突破極限。OpenAI 可能延遲發布以充分與監管方溝通,預計年底才會推出 Fable 級別的新模型,避免 Anthropic 被迫下架的局面。

  • 3

    開源模型崛起的轉折點:Zeta AI 發布的 GLM 5.2 展示了開源競爭力的質變,在多項編碼基準測試中超越 GPT 5.5,上下文窗口從 20 萬令牌擴展到 100 萬,支持整個代碼庫一次性加載處理,且以 MIT 授權發布,可商用部署。

  • 4

    監管環境倒逼開源方案採用:政府限制推高了閉源商用模型的訪問門檻,使得開源自部署方案成為可行替代,尤其對非美國用戶而言。這標誌著 AI 應用策略從雲端依賴向本地部署和開源優先轉變。

實用技巧與重點

乾貨
  • 政策與監管
  • Anthropic Fable 5 訪問截止日期:2026 年 6 月 22 日
  • Fable 5 從完全下架到關閉僅間隔 2-3 天
  • 政府限制目標:防止非美國居民訪問高能力模型
  • GPT 5.6 預期訪問要求:身份驗證、政府 ID、自拍視頻
  • GLM 5.2 技術規格
  • 上下文窗口:100 萬令牌(前版本 20 萬)
  • 推理模式:High(平衡模式)、Max(複雜任務模式)
  • 授權協議:MIT 開源
  • 能力範圍:支持整個中等規模代碼庫單次加載
  • 性能基準(Zeta AI 測試結果)
  • 編碼基準測試:GLM 5.2 > GPT 5.5
  • 長期軟體工程任務:GLM 5.2 > GPT 5.5
  • 邊界軟體工程馬拉松:Claude Opus 4.8 > GLM 5.2 > GPT 5.5(多項)
  • Gemini 比較:GLM 5.2 全面超越 Gemini 3.1 Pro
  • 特定工具測試:Cyber Engineering Bench Pro、MCP Atlas、工具使用測試
  • 市場預期
  • GPT 5.6 傳聞發布日期:6 月中旬(未確定)
  • Codex 團隊承諾:每週四更新發布
  • Gemini 3.5 Pro 預期:本月發布

結論

結論

監管限制推動了 AI 應用策略的根本性轉變——從全球雲端模型依賴轉向本地開源自主部署,開源社群的技術突破使這個轉變變得可行且高效。

完整解析

詳細

AI 產業在 2026 年上半年迎來了前所未有的監管干預。美國政府首次主動限制人工智能模型的全球訪問權限,直接針對 Anthropic 的 Fable 5 模型,要求僅向美國用戶提供訪問,並設定 6 月 22 日的下架期限。這個決策背後的邏輯是政府不希望非美國居民、尤其是可能的競爭對手國家的居民獲得高能力 AI 模型的訪問權。這一事件立即影響了產業的發布節奏和策略。

OpenAI 的 GPT 5.6 成為這場監管風暴的直接受影響者。原定於 6 月中旬發布的 GPT 5.6,現在面臨延遲或受限的風險。根據已洩露的檢查點信息,GPT 5.6 並非 Fable 級別的革命性模型,而是 GPT 5.5 的漸進升級版本。它在編碼和推理能力上會有改進,但不會像 Fable 5 那樣打破現有能力邊界。OpenAI 從 Anthropic 的遭遇中吸取教訓,正在與美國政府協調發布條件,計畫為新模型加入身份驗證機制,包括政府身份證確認和自拍視頻驗證,以確保合規性。這意味著如果發布,GPT 5.6 可能只對美國用戶開放,這對全球使用者造成重大打擊。

然而,就在這個監管收緊的時刻,開源社群展現了令人驚艷的技術進展。Zeta AI 發布的 GLM 5.2 模型在多項編碼基準測試中超越了 GPT 5.5,這在開源模型史上是個重大里程碑。GLM 5.2 將上下文窗口從 20 萬令牌擴展到 100 萬,使其能一次性加載整個中等規模代碼庫,包括源文件、測試、配置和完整對話歷史,全部保留在工作記憶中而不需摘要化。模型支援兩個推理模式:High 模式在令牌成本和效能間取得平衡,Max 模式針對複雜多步驟任務優化。更重要的是,GLM 5.2 以 MIT 授權發布,意味著任何人可以下載、在本地硬體上運行,甚至商用部署,幾乎沒有限制。在多項測試中,它不僅超越 GPT 5.5,也全面超越了 Google 的 Gemini 3.1 Pro,唯一超越它的是 Anthropic 的 Claude Opus 4.8。

這一切共同指向一個關鍵轉折點:閉源商業模型面臨政府限制和訪問障礙,而開源方案逐漸變得足夠強大且無限制。對於非美國用戶和追求自主部署的組織而言,從雲端模型轉向本地開源方案不再是妥協,而是更務實的選擇。隨著 Google 即將發布 Gemini 3.5 Pro,市場競爭會進一步激化,但開源陣營已展示出它能與頂級實驗室在多個關鍵維度上抗衡的能力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。