GPT-5.6 Release | Limited Preview | All-New Naming System | Sol/Terra/Luna | Maximum Reasoning Ef...
三句話摘要
OpenAI發佈GPT-5.6系列三款模型,採用分階段開放策略並配套四層安全防護機制。 OpenAI從卷速度轉向卷安全,能力越強的模型採用越謹慎的分階段發佈和越強的防護機制,這標誌著頂級AI模型的發展邏輯已與監管深度綁定。 新的產品分層體系:用天體名稱取代數字後綴,Sol是性能頂尖的旗艦模型,Terry是性能對標GPT-5.5但價格減半的平衡型,Luna走低成本高吞吐路線,三個能力挡位都將長期存在各自按節奏迭代,不再是速度競賽。
重點整理
重點- 1
新的產品分層體系:用天體名稱取代數字後綴,Sol是性能頂尖的旗艦模型,Terry是性能對標GPT-5.5但價格減半的平衡型,Luna走低成本高吞吐路線,三個能力挡位都將長期存在各自按節奏迭代,不再是速度競賽。
- 2
推理能力突破:首次開放可調的最大推理努力挡位讓模型花更多計算資源做深度思考;Ultramode下的紫智能體協作能自動將複雜任務拆分給多個子智能體並行處理,大幅縮短大型任務耗時,但成本會增加。
- 3
安全防護與能力平衡:採用四層防護機制(訓練階段拒絕、生成過程實施分類、賬號級跨對話審查、差異化訪問權限),確保強能力配上強約束,同時不堵死合法的安全研究工作如代碼審查、漏洞研究、防御性測試。
- 4
謹慎的分階段發佈:不再直接全面開放強模型,而是先通過API與Codex向可信合作伙伴開放,驗證安全機制後逐步擴大,反映出行業發展邏輯從卷速度轉向卷安全,能力強度與監管深度開始綁定。
實用技巧與重點
乾貨- 產品定位與命名
- Sol(太陽):旗艦款,最頂尖能力
- Terry(地球):平衡款,對標GPT-5.5
- Luna(月亮):入門款,低成本高吞吐
- 核心新功能
- 最大推理努力挡位:讓模型在複雜任務上投入更多計算資源與思考時間
- Ultramode 紫智能體協作:自動任務拆分、並行處理、結果整合
- 性能數據
- Terminal Batch 2.1基準測試:Sol達91.9%,比第二名高3.1個百分點
- Gini Batch V1(生物科研):比GPT-5.5更強,輸出token更少
- Exploit Batch:Sol用1.3倍輸出token與Messos打平
- ExploidGene基準:Sol、Terry、Luna都呈現推理深度越高安全能力越強的規律
- 定價(美元/百萬token)
- Sol:輸入$5、輸出$30
- Terry:輸入$2.5、輸出$15(為Sol的一半)
- Luna:輸入$1、輸出$6
- 提示詞緩存機制
- 最短保留時間:30分鐘(可控可預期)
- 寫入價格:1.25倍模型輸入價格
- 讀取價格:享受90%折扣
- 硬件加速
- 7月份在Cyberus經研級芯片上部署Sol
- 推理速度最高每秒750個token
- 四層安全防護
- 訓練階段拒絕非法網絡協助與越獄請求
- 生成過程中實施分類器(網絡安全與生物安全)暫停高風險生成並調用大模型重審
- 賬號級跨對話審查,區分一次性誤判與持續惡意行為
- 差異化訪問權限,根據風險等級逐步授權
- 紅隊測試投入
- 自動化測試:投入超70萬A100等效GPU小時
- 人工紅隊測試:第三方安全專家進行創意性攻擊測試
- 上線節奏
- 目前階段:有限預覽,通過API與Codex向可信合作伙伴開放
- 未來幾周:三款模型全面可用
- 後續階段:逐步擴大到ChatGPT、Codex、API更多用戶
- 官方安全聲明
- Sol未達到OpenAI自身准入框架定義的網絡安全臨界預值
- 能識別Chromium與Firefox漏洞組件,但無法在測試條件下自主生成完整端到端利用程序
- 合法使用包括:代碼審查、漏洞研究、補丁開發、調試、安全教育、防御性測試
結論
結論“OpenAI從卷速度轉向卷安全,能力越強的模型採用越謹慎的分階段發佈和越強的防護機制,這標誌著頂級AI模型的發展邏輯已與監管深度綁定。”
完整解析
詳細OpenAI在6月26日發佈GPT-5.6系列,這不單純是模型性能的增量迭代,而是對整個產品體系的重要梳理。最核心的變化是命名體系的重新設計——廢棄數字後綴,改用Sol(太陽)、Terry(地球)、Luna(月亮)三個天體代表三個能力挡位。這三個挡位將長期並存,各自按照自己的節奏迭代升級,打破了過去「新版本發布就必須強於舊版本」的競速邏輯。
Sol是系列旗艦,代表OpenAI當前最頂尖的能力,專門應對最複雜的前沿任務。在Terminal Batch 2.1編碼基準測試中,Sol達到91.9%的得分,比第二名領先3.1個百分點——這個差距在頂級模型梯隊已經算是相當明顯。Terry定位平衡型,性能對標上代的GPT-5.5,但價格直接減半(輸入$2.5、輸出$15對比Sol的$5和$30),適合有大量日常調用需求的常規工作流。Luna則走低成本高吞吐路線,輸入僅$1、輸出$6,專為大批量標準化任務設計。
除了新的分層架構,這次發佈的技術突破集中在推理能力上。首次開放的「最大推理努力挡位」讓開發者可調整模型的計算預算——遇到複雜的數學推理、多步規劃或代碼開發任務時,開高檔位換準確率;日常簡單任務則用默認檔位保速度。這直接回應了業界長期的痛點:之前大模型推理深度基本固定,複雜任務容易出疏漏。另一個突破是Ultramode下的多智能體協作機制,模型會自動將大型任務拆分成多個子模塊,分配給不同的子智能體並行處理,最後整合結果。這突破了單體智能體的能力邊界,但調用成本會增加,更適合高難度核心任務。
性能表現上,生物科研領域用Gini Batch V1測試,Sol比GPT-5.5更強且輸出token更少,相當於成本更低卻效果更好。網絡安全能力是官方重點強調的部分——在Exploit Batch上,Sol用1.3倍輸出token就與Messos打平,意味著完成同難度的漏洞分析需要更短的輸出和更少步驟。在ExploidGene基準中,Sol、Terry、Luna三個模型都呈現同一規律:推理深度越深,網絡安全能力越強。這與最大推理努力挡位形成了呼應——給模型足夠時間思考,即使是入門級Luna也能在安全任務上表現更好。
不過官方也明確聲明了限制:Sol並未達到OpenAI自身框架定義的網絡安全臨界預值。在Chromium和Firefox的測試中,模型能識別漏洞和利用的基礎組件,但無法在測試條件下自主生成完整可用的端到端利用程序。正因為這種不確定性,以及模型能力的跳躍式提升,官方才採取了更強的安全防護和分階段發佈策略。
安全防護採用四層機制。第一層在訓練階段就對模型進行優化,遇到明確的非法網絡協助請求直接拒絕。第二層是生成過程中的實施分類器,專門針對網絡安全和生物安全的濫用,在生成中評估,高風險時暫停生成並調用更強的大模型重審上下文。第三層是賬號級跨對話審查,避免單看某條對話造成的誤判——這對雙用途場景特別重要,因為安全技術本身是中性的,攻防都會用到,但連看多條對話就能區分持續惡意還是正常研究。第四層是差異化訪問權限,不同客戶、用戶、工作負載有不同等級,敏感能力默認不開放,根據風險逐步授權。
為了驗證這套防護是否可靠,OpenAI投入了超70萬A100等效GPU小時進行自動化紅隊測試,目標是尋找通用漏洞——能跨多個提示詞、多種場景生效的攻擊方式。同時還與第三方專家合作進行人工紅隊測試,因為創意性的攻擊(社會工程學、多層上下文包裝、跨步驟編排)是自動化很難覆蓋的。發現的所有漏洞都進入快速響應流程,修復後就能防住所有同類攻擊。
提示詞緩存是重要的成本優化機制。新的緩存支持顯式設置斷點,最短保留30分鐘(生命週期可控可預期),寫入時按1.25倍輸入價格計費,讀取享受90%折扣。對文檔分析、代碼庫問答、多輪對話這類場景,前置上下文重複度高,用緩存能大幅降低成本,許多之前無法商業化的場景現在都可行了。硬件上,7月份將在Cyberus經研級芯片部署Sol,推理速度最高每秒750個token,初期僅面向精選客戶,後續隨產能擴充逐步開放。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


