Introducing ChatGPT Work, powered by Codex and GPT-5.6
三句話摘要
OpenAI 發布 GPT-5.6 及配套產品套件,為企業和個人提供自主工作的 AI 工具。 GPT-5.6 的核心突破是從「回答問題的工具」轉變為「獨立執行複雜工作流程的代理」,透過強化學習與預訓練的疊加,以及計算機操作能力的加入,使 AI 能夠像經驗豐富的同事一樣思考、規劃與執行。 模型訓練突破
重點整理
重點- 1
模型訓練突破
- 2
2024 年推出推理範式後,OpenAI 持續擴展強化學習和預訓練規模,兩者疊加產生指數級改進。GPT-5.6 Sol 已能自主完成 Luna 的後訓練工作,顯示模型已達到近似「自動化研究員」的能力。
- 3
工作流程自動化
- 4
ChatGPT Work 整合了複雜任務的端到端執行——金融團隊用單次提示完成方差分析、更新預測模型、生成報表和互動式網站;招聘團隊用排程任務追蹤面試進度;數據科學團隊用視覺化功能加速臨時分析。
- 5
計算機操作能力
- 6
GPT-5.6 在瀏覽器導航、應用程式控制、檔案管理上達到業界最佳,可自主執行電子健康記錄查詢、藥物效能分析、金融模型建構等專業工作流程。
- 7
成本效率與規模
- 8
在 DeepSuite 1.1 評測上以少於競爭對手一半的成本超越其他模型;新增 Ultra Mode 讓多個代理並行工作,進一步提升速度和準確度。
實用技巧與重點
乾貨- 模型與產品
- GPT-5.6 Sol(最強模型)、Terra(中階日常)、Luna(輕量快速)
- ChatGPT Work:網頁、行動、桌面多平台
- 桌面應用新增:本地檔案、瀏覽器標籤、應用程式控制、電腦操作
- Hosted Sites:生成並分享互動式網站
- Ultra Mode:多代理並行工作
- 性能指標
- 用戶規模:每週近 10 億 ChatGPT 用戶
- 編碼性能:Terminalench 上 SOTA
- 資訊檢索:Browse Comp 上 SOTA(尋找難以定位的資訊)
- 長期工作:Agent's Last Exam 上 SOTA
- 成本效率:GPT-5.6 在 DeepSuite 1.1 上成本低於競爭對手 50%
- 速度提升:內部測試快 3 倍
- 安全投入
- 紅隊測試:70 萬 A100 等效計算小時
- 安全訓練:6 週全面測試
- Project Daybreak:提前向網安研究者提供模型
- Patch Planet:與開源社群合作,Linux 項目接受超過 50% 的自動補丁
- 具體案例數據
- 金融分析:自動完成方差分析、預測更新、PPT 生成、網站構建
- 內容整合:90 秒內整合多份文件、網頁標籤和資料夾,生成完整簡報
- 農業應用:日本農場利用模型實現種植面積管理自動化
結論
結論“GPT-5.6 的核心突破是從「回答問題的工具」轉變為「獨立執行複雜工作流程的代理」,透過強化學習與預訓練的疊加,以及計算機操作能力的加入,使 AI 能夠像經驗豐富的同事一樣思考、規劃與執行。”
完整解析
詳細OpenAI 在本次發表會上展示了過去一年在模型能力上的根本性進展。自 2024 年推出推理範式(一種強化學習技術用於解決最難的任務)以來,研究團隊持續擴展強化學習和預訓練的規模,兩者相乘產生指數級改進。GPT-5.6 正是這一研究累積的最新成果,分為三個版本:Sol 用於最複雜的代理型工作流程,Terra 用於日常工作,Luna 則是速度最快且最經濟的選擇。
產品層面,ChatGPT Work 是新推出的核心功能,特別擅長理解複雜內容、執行長期任務、操作試算表、編輯網站等。金融團隊的演示尤其令人印象深刻——過去需要手工協調多個系統、Excel 模型的工作,現在透過一次提示就能完成:自動執行方差分析找出預測偏差原因、更新 Excel 模型中的數據、生成 PowerPoint 簡報與互動式網站,再一鍵將網站連結傳送至 Slack。這種端到端的自動化使金融團隊能以精簡的人力運作。
桌面應用則進一步擴展了能力邊界。它可以訪問使用者的本地檔案、瀏覽器標籤,甚至控制電腦上的其他應用程式。在演示中,GPT-5.6 能在 90 秒內查閱一個文件夾內的多份資料(啟動準備文件、使用者研究訪談、安全審查報告)以及開啟的 Chrome 標籤,然後按照公司慣用範本生成可直接報告的簡報;它也能自主控制 Apple Notes 應用,建立資料夾並整理雜亂的筆記。這種「計算機操作」能力在多個專業領域具有實際價值:醫療助理可用於導航電子健康記錄、數據科學家可用於分析藥物效能、投資銀行家可用於構建財務模型。
在安全與對齐方面,OpenAI 投入了 70 萬 A100 等效計算小時進行紅隊測試,花費 6 週進行安全訓練與測試,並部署了多項創新的監測升級。透過 Project Daybreak 與網安研究者合作,GPT-5.6 Sol 已經在每一個主要瀏覽器和資料庫中發現了漏洞。更重要的是,透過 Patch Planet 計畫與開源社群合作,模型生成的高品質補丁中超過 50% 被 Linux 項目接受,這表明模型不僅能發現長期未被發現的關鍵漏洞,更能自動生成可用的修復。
一位日本農場主 Hiroki 的案例展示了技術的非傳統應用——他原本不是工程師,卻透過逐步提示 ChatGPT,從手動控制農場設施的馬達到建立完整系統,實現了小型團隊管理大規模田地的自動化。這個案例強調了 AI 的民主化價值:即便是非技術背景的人,只要願意從小處開始、逐步提升抱負,也能善用 AI 完成原本不可能的工作。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


