KeyFrame內部研究專用

Introducing ChatGPT Work, powered by Codex and GPT-5.6

OpenAI·7月9日週四·35 min英文

三句話摘要

OpenAI 發布 GPT-5.6 及配套產品套件,為企業和個人提供自主工作的 AI 工具。 GPT-5.6 的核心突破是從「回答問題的工具」轉變為「獨立執行複雜工作流程的代理」,透過強化學習與預訓練的疊加,以及計算機操作能力的加入,使 AI 能夠像經驗豐富的同事一樣思考、規劃與執行。 模型訓練突破

重點整理

重點
  • 1

    模型訓練突破

  • 2

    2024 年推出推理範式後,OpenAI 持續擴展強化學習和預訓練規模,兩者疊加產生指數級改進。GPT-5.6 Sol 已能自主完成 Luna 的後訓練工作,顯示模型已達到近似「自動化研究員」的能力。

  • 3

    工作流程自動化

  • 4

    ChatGPT Work 整合了複雜任務的端到端執行——金融團隊用單次提示完成方差分析、更新預測模型、生成報表和互動式網站;招聘團隊用排程任務追蹤面試進度;數據科學團隊用視覺化功能加速臨時分析。

  • 5

    計算機操作能力

  • 6

    GPT-5.6 在瀏覽器導航、應用程式控制、檔案管理上達到業界最佳,可自主執行電子健康記錄查詢、藥物效能分析、金融模型建構等專業工作流程。

  • 7

    成本效率與規模

  • 8

    在 DeepSuite 1.1 評測上以少於競爭對手一半的成本超越其他模型;新增 Ultra Mode 讓多個代理並行工作,進一步提升速度和準確度。

實用技巧與重點

乾貨
  • 模型與產品
  • GPT-5.6 Sol(最強模型)、Terra(中階日常)、Luna(輕量快速)
  • ChatGPT Work:網頁、行動、桌面多平台
  • 桌面應用新增:本地檔案、瀏覽器標籤、應用程式控制、電腦操作
  • Hosted Sites:生成並分享互動式網站
  • Ultra Mode:多代理並行工作
  • 性能指標
  • 用戶規模:每週近 10 億 ChatGPT 用戶
  • 編碼性能:Terminalench 上 SOTA
  • 資訊檢索:Browse Comp 上 SOTA(尋找難以定位的資訊)
  • 長期工作:Agent's Last Exam 上 SOTA
  • 成本效率:GPT-5.6 在 DeepSuite 1.1 上成本低於競爭對手 50%
  • 速度提升:內部測試快 3 倍
  • 安全投入
  • 紅隊測試:70 萬 A100 等效計算小時
  • 安全訓練:6 週全面測試
  • Project Daybreak:提前向網安研究者提供模型
  • Patch Planet:與開源社群合作,Linux 項目接受超過 50% 的自動補丁
  • 具體案例數據
  • 金融分析:自動完成方差分析、預測更新、PPT 生成、網站構建
  • 內容整合:90 秒內整合多份文件、網頁標籤和資料夾,生成完整簡報
  • 農業應用:日本農場利用模型實現種植面積管理自動化

結論

結論

GPT-5.6 的核心突破是從「回答問題的工具」轉變為「獨立執行複雜工作流程的代理」,透過強化學習與預訓練的疊加,以及計算機操作能力的加入,使 AI 能夠像經驗豐富的同事一樣思考、規劃與執行。

完整解析

詳細

OpenAI 在本次發表會上展示了過去一年在模型能力上的根本性進展。自 2024 年推出推理範式(一種強化學習技術用於解決最難的任務)以來,研究團隊持續擴展強化學習和預訓練的規模,兩者相乘產生指數級改進。GPT-5.6 正是這一研究累積的最新成果,分為三個版本:Sol 用於最複雜的代理型工作流程,Terra 用於日常工作,Luna 則是速度最快且最經濟的選擇。

產品層面,ChatGPT Work 是新推出的核心功能,特別擅長理解複雜內容、執行長期任務、操作試算表、編輯網站等。金融團隊的演示尤其令人印象深刻——過去需要手工協調多個系統、Excel 模型的工作,現在透過一次提示就能完成:自動執行方差分析找出預測偏差原因、更新 Excel 模型中的數據、生成 PowerPoint 簡報與互動式網站,再一鍵將網站連結傳送至 Slack。這種端到端的自動化使金融團隊能以精簡的人力運作。

桌面應用則進一步擴展了能力邊界。它可以訪問使用者的本地檔案、瀏覽器標籤,甚至控制電腦上的其他應用程式。在演示中,GPT-5.6 能在 90 秒內查閱一個文件夾內的多份資料(啟動準備文件、使用者研究訪談、安全審查報告)以及開啟的 Chrome 標籤,然後按照公司慣用範本生成可直接報告的簡報;它也能自主控制 Apple Notes 應用,建立資料夾並整理雜亂的筆記。這種「計算機操作」能力在多個專業領域具有實際價值:醫療助理可用於導航電子健康記錄、數據科學家可用於分析藥物效能、投資銀行家可用於構建財務模型。

在安全與對齐方面,OpenAI 投入了 70 萬 A100 等效計算小時進行紅隊測試,花費 6 週進行安全訓練與測試,並部署了多項創新的監測升級。透過 Project Daybreak 與網安研究者合作,GPT-5.6 Sol 已經在每一個主要瀏覽器和資料庫中發現了漏洞。更重要的是,透過 Patch Planet 計畫與開源社群合作,模型生成的高品質補丁中超過 50% 被 Linux 項目接受,這表明模型不僅能發現長期未被發現的關鍵漏洞,更能自動生成可用的修復。

一位日本農場主 Hiroki 的案例展示了技術的非傳統應用——他原本不是工程師,卻透過逐步提示 ChatGPT,從手動控制農場設施的馬達到建立完整系統,實現了小型團隊管理大規模田地的自動化。這個案例強調了 AI 的民主化價值:即便是非技術背景的人,只要願意從小處開始、逐步提升抱負,也能善用 AI 完成原本不可能的工作。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。