KeyFrame內部研究專用

GPT-5.6 Limited Preview: Behind the 6 Major Upgrades, Is AI Entering a Dual-Track Era?

灵姐说AI | Ling Talk AI·6月27日週六·17 min中文

三句話摘要

OpenAI GPT-5.6 模型釋出及其三層架構、核心升級方向與監管框架下的開放策略。 GPT-5.6 的釋出和受控開放反映了 AI 產業已進入從技術競爭向國家基礎設施和安全治理競爭的轉變階段,高能力模型的未來開放模式將採用雙軌制,影響 API 獲取、企業合作和開源邊界。 分層品牌化命名的產品策略轉變——OpenAI 改用"太陽、地球、月亮"這類長期品牌化命名,而非工程化的 Pro/Mini/Nano,這反映了 Anthropic Opus/Sonnet/Haiku 命名體系的成功,模糊了工程屬性、強化了品牌感知,使使用者在選擇時能明確理解智慧度、速度和成本的權衡關係。

重點整理

重點
  • 1

    分層品牌化命名的產品策略轉變——OpenAI 改用"太陽、地球、月亮"這類長期品牌化命名,而非工程化的 Pro/Mini/Nano,這反映了 Anthropic Opus/Sonnet/Haiku 命名體系的成功,模糊了工程屬性、強化了品牌感知,使使用者在選擇時能明確理解智慧度、速度和成本的權衡關係。

  • 2

    Agent 和 Codex 能力的內化升級——GPT-5.6 不只是讓單個 Agent 更強,而是將多 Agent 協作能力內建到模型中,使得一個上下文可以自然生成程式碼閱讀、測試編寫、Bug 修復、文件查詢、安全審計等多角色分工,降低了使用 API 編排的摩擦成本。

  • 3

    Prompt Caching 解決上下文成本膨脹——透過快取大型專案的程式碼結構、文件、規範等長上下文,首次讀取成本提升 1.25 倍,但後續呼叫同批快取內容享受 90% 折扣,適配長週期 Agent 工作流的高頻呼叫場景。

  • 4

    監管框架下的雙軌制演變——美國政府對 Faber 下架、MySOS 受限的監管邏輯正轉移到 GPT-5.6,表明高能力模型未來可能分為公開版(面向普通開發者、限制多)和受信版(僅供稽核透過的政府、基礎設施、科研機構),體現了 AI 開發從純技術競爭向國家基礎設施競爭的轉變。

實用技巧與重點

乾貨
  • 模型定價(每百萬 Token)
  • Soul 版本:輸入 $5、輸出 $30
  • Luna 版本:輸入 $1、輸出 $6
  • 核心升級
  • Agentic 模式(多 Agent 內建協作)
  • Max 推理強度(可調深度推理)
  • Prompt Caching(未快取輸入 1.25 倍價格;快取命中享受 90% 折扣)
  • 評測指標
  • GPT-5.6 Soul 在 Agentic 工作流評分達 91.9%(超 Claude MySOS 和 Cyber)
  • 開放狀態
  • Limited Preview(有限預覽)
  • 僅向受信任合作伙伴、企業、透過 API/Codex 開放
  • GA 時間未定
  • 關聯事件
  • Anthropic 指控阿里巴巴用 2.5 萬個賬戶爬取 Claude 模型
  • 美國政府稽核 GPT-5.6 開放範圍和物件
  • Faber 模型下架、MySOS 受限

結論

結論

GPT-5.6 的釋出和受控開放反映了 AI 產業已進入從技術競爭向國家基礎設施和安全治理競爭的轉變階段,高能力模型的未來開放模式將採用雙軌制,影響 API 獲取、企業合作和開源邊界。

完整解析

詳細

OpenAI 在 6 月 26 日釋出 GPT-5.6,這是繼 GPT-5.5 後的重大升級。新模型採用了天體命名法:Soul 代表太陽(旗艦最強)、Terra 代表地球(主力成本平衡)、Luna 代表月亮(高效低成本)。這一命名方式並非技術細節,而是品牌化策略的轉變——它借鑑了 Anthropic 成功的 Opus/Sonnet/Haiku 命名體系,放棄了 Pro/Mini/Nano 這類工程化術語,使使用者在選擇時能直觀理解模型的位階關係。

在能力升級方面,GPT-5.6 的核心改進集中在 Agent 和 Codex 工作流。官方強調的是 Soul 版本在編碼、生物科學、網路安全領域達到了新高度,尤其是在 Agentic 工作流評分上達到 91.9%,超越了 Claude 的相應模型。最關鍵的創新是模型內建了多 Agent 協作能力——過去開發者需要透過 API 編排多個代理分工執行,現在模型可以自然地在一個上下文內生成程式碼閱讀、單元測試、Bug 修復、文件查詢、安全審計等多角色任務,這大幅降低了複雜工程專案的協調成本。

成本管理方面,GPT-5.6 引入了 Prompt Caching 機制。在使用大型程式碼庫、文件集合等長上下文的專案中,首次載入這些材料的成本提升 25%(1.25 倍),但之後對同一批快取內容的呼叫可享受 90% 的折扣。這對長週期的 Agent 工作流特別有價值,因為它反覆呼叫相同的程式碼結構、規範和文件。此外,模型增加了 Max 推理強度選項,允許使用者在普通任務中使用低推理模式省成本、在複雜問題上選用更深度的推理,實現了能力和成本的動態平衡。

然而,開放策略上出現了重大變化。GPT-5.6 目前處於 Limited Preview(有限預覽)狀態,僅向受信任的企業合作伙伴和組織透過 API 開放,普通使用者暫時無法使用。這與 Anthropic 的 Faber 模型下架、MySOS 被限制訪問的時間線高度重合——都是在美國政府介入後採取了受控開放策略。業界觀點認為,高能力模型在網路安全、生物科研、軍事等敏感領域的應用潛力已引起政府重視,未來可能演變為"雙軌制":公開版面向普通開發者、提供完整功能但加入安全限制;受信版(Trustworthy Version)僅供稽核透過的政府機構、基礎設施建設者、科研單位和少數合作伙伴使用。這標誌著 AI 競爭從純粹的技術能力比拼,轉向以國家基礎設施管控和模型安全治理為核心的更高層次競爭。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。