KeyFrame內部研究專用

Codex from 0 to 10M Users: Building ChatGPT Work — Akshay Nathan, OpenAI

Latent Space·7月28日週二·69 min英文

三句話摘要

OpenAI产品负责人深度解析ChatGPT Work推出的产品演进与未来愿景。 AI时代的生产力不再由工具决定,而由目标的清晰度和验证反馈的紧密度决定——区分motion和progress,精确定义成功样子,是管理者和product leader最紧急的任务。 产品合并的核心动机:内部观察发现Codex的能力对非开发者同样强大,员工为能使用这类工具感到骄傲。这启发了一个关键问题:如何将这种"超能力"推向ChatGPT的数亿用户?答案是统一产品而非分割,让用户自由选择而非被强制分类。

重點整理

重點
  • 1

    产品合并的核心动机:内部观察发现Codex的能力对非开发者同样强大,员工为能使用这类工具感到骄傲。这启发了一个关键问题:如何将这种"超能力"推向ChatGPT的数亿用户?答案是统一产品而非分割,让用户自由选择而非被强制分类。

  • 2

    架构统一、体验差异化的设计:底层harness完全相同,确保两个产品都能获得最新的agents、artifacts、plugins等能力。但在UX层面做出不同权衡:ChatGPT优化延迟与对话流畅性(搜索、学习),ChatGPT Work则突出diff展示、代码可见性、沙箱安全等。这体现了"不想让用户被限制在某个tab里"的产品哲学。

  • 3

    多阶段扩展战略:开发者(早期采用)→知识工作者(财务、营销等全职能)→所有人(包括个人生活中的生产力)。每个阶段都应用前一阶段的学习,逐步降低使用摩擦。当前重点是让"不知道自己能用AI做什么"的人看到实际例子,而非告诉他们——让产品自己说话。

  • 4

    生产力测量的本质:放弃用代码行数、story points这类代理指标,转向直接问"用户是否在朝目标进展?"。内部衡量标准是"at bats"质量——团队能否高效完成从想法→构建→反馈→迭代的闭环。这要求管理者对"成功长什么样"有精确定义,否则容易把motion(看起来在做东西)误当成progress(真实朝目标推进)。

實用技巧與重點

乾貨
  • 用户规模与时间线
  • ChatGPT Work推出时:10 million users
  • 两周内增长至:100+ million users
  • 产品与模式名称
  • ChatGPT(经典harness)—— 延迟优化、对话为中心
  • Codex harness —— computer environment、agents、artifacts、plugins为中心
  • ChatGPT Work —— 知识工作场景的统一体验
  • o1-mini 和 o1 —— 推理模型,默认用o1-mini(成本与速度的平衡)
  • Claude Opus/Sonnet —— 可作为sub-agents使用的替代模型
  • 核心功能清单
  • Artifacts:可实时编辑的Excel、PowerPoint、Docs、Sites
  • Computer use:agent可直接操作用户计算机环境
  • Plugins和MCP:连接外部数据源(财务应用、日历、Slack等)
  • Memory v3:跨对话持久化用户背景,自动继承到ChatGPT Work
  • Chronicle(实验性):自动监听用户电脑活动,生成更深层的memory
  • Sub-agents:支持并行任务执行和成本优化(小模型处理搜索等)
  • Speed/Quality slider:单维度投影(延迟 ↔ 深度),默认用o1-mini
  • 具体案例的关键数据
  • 游戏设计:30张照片 → 7亿代币 → 完整3D游戏网页 + 自对弈AI训练系统
  • 退休计算器:可编辑的Excel式表格(无需Excel许可证)
  • Sites作为研究输出:替代Markdown,提供更高的可视化信息带宽
  • 公司财务报告:从PPT/Excel转向Sites,提升团队协作效率
  • 评审收集:从Slack、代码、文档等多源自动聚合员工背景
  • 产品决策与原则
  • 不强制分离体验,用户可自由切换(由model router智能判断何时进入Work模式)
  • 默认配置应该对多数人最优,高级用户可通过Advanced menu调整
  • 显示足够信息让用户验证过程(不完全黑盒),但避免overwhelming
  • Chronicle默认关闭但可启用,自动学习用户工作模式
  • 权限模型需慎重(如多人协作时,谁能看到artifacts?)

結論

結論

AI时代的生产力不再由工具决定,而由目标的清晰度和验证反馈的紧密度决定——区分motion和progress,精确定义成功样子,是管理者和product leader最紧急的任务。

完整解析

詳細

这场访谈捕捉了OpenAI核心产品团队对"如何让AI能力惠及更广泛人群"这一长期问题的最新答案。Akshay的职业轨迹很关键——他曾在Walrus(无代码自动化)、Airtable(低代码数据库)和OpenAI企业部工作,这些经历都围绕同一个信念:让普通人能够使用曾经只有工程师才能掌握的超能力。LLMs到来时,这个愿景终于有了缺失的技术基础。

ChatGPT Work的推出故事始于一个内部观察。当Codex发布时,Akshay在内部UXR(用户研究)会议上发现了一个令人惊讶的现象:非技术部门(财务、市场营销等)的员工都开始使用Codex,更令人印象深刻的是他们为此感到骄傲——"我不应该能用这个,但我在用",这种自豪感源于他们获得了原本属于开发者的"超能力"。这启发了一个关键的产品问题:为什么要限制这种能力只给开发者?如何将其推向ChatGPT数亿用户中不知道他们能做什么的人?

产品架构上,OpenAI做了一个聪明的决定:统一底层技术(harness),但在UI/UX层面保持区分。具体来说,ChatGPT和ChatGPT Work共享同一个计算引擎——同样的agents系统、同样的artifacts能力、同样的plugins连接。这意味着两个产品都能实时获得最新的能力。但他们在用户面向的设计上做了有针对性的权衡:Classic ChatGPT因为需要优化延迟、个性化和对话流畅性,所以对artifacts的细节展示更少(保持对话聚焦);ChatGPT Work则完全相反,积极展示代码diff、计算过程、所有的中间步骤——因为知识工作者需要验证agent的推理过程。这种设计来自一个深刻的洞察:现代工作的边界已经模糊了,一个人在一天内可能会从写代码切换到制作财务报告、再切换到规划营销活动。强行用"这是给开发者的"或"这是给非开发者的"来分割产品,违背了AI正在改变的现实。

在功能层面,一些创新尤其值得关注。Artifacts系统让AI不再只输出代码片段,而是完整的可编辑HTML(Sites)、Excel表格、PowerPoint演示。其中Sites尤其有趣——虽然Twitter上很多人吹捧它作为"原型工具",但Akshay指出一个更重要的用法:Sites本身成为了知识工作的一个新的输出格式。他提到公司财务团队现在用Sites替代月度报告中的PPT和Excel——不是因为Sites更漂亮,而是因为当你有无限灵活的HTML canvas和一个能够理解意图的AI时,信息组织和更新的成本大幅下降。访谈嘉宾展示了一个游戏设计的例子:他用30张手机照片、一个简单的prompt,ChatGPT Work花了7亿个tokens生成了一个完整的可玩网页游戏,包含3D块级放置逻辑和自对弈的AI训练框架。这在一年前是完全不可想象的工作量。

Memory系统是另一个战略性的设计。新的Memory v3和实验性的Chronicle功能让AI能够跨多个对话持久化对用户的理解。特别是Chronicle——它自动学习用户在电脑上做什么,识别patterns——提供了更深层的背景。这在ChatGPT Work中尤其强大,因为所有新对话默认继承用户的memory,使得从ChatGPT切换到Work感觉像是一个自然的延续而非迁移。Akshay说有人甚至看到自己的memory档案时感到惊讶——"我都忘了我做过这个,但记录在这里"——这说明memory不只是记录,还能主动表面隐藏的价值。

关于模型选择,OpenAI的策略是"good defaults, power user options"。他们为Speed/Quality设计了一个单维度滑块(底层是o1-mini到o1的映射),绝大多数人应该用默认配置。但对于那些想要构建可复用工作流的人,可以在Advanced设置中手动调整models、reasoning effort、sub-agent模型等。这里有个有趣的观察:许多power users会告诉模型"用sub-agents"来优化成本和延迟,而Sonnet/Opus的组合(用Sonnet做小任务)被证明既便宜又快。

核心的生产力测量框架也有重大转变。传统的proxy metrics(代码行数、story points)在AI时代开始失效,因为你可能用一个prompt完成原本需要100行代码的工作。Akshay提出的替代方案是"at bats"——衡量团队能否高效地执行从"产生想法→快速构建→收集反馈→基于反馈迭代→验证假设→进入下一个周期"这样的完整循环。这要求管理者非常清晰地定义成功样子,否则很容易把"看起来在做东西"(motion)误当成"真的在朝目标推进"(progress)。这个区别至关重要,因为AI让motion变得极其廉价,任何人都可以迅速生成很多东西,但那些东西中有多少真的推进了目标?

关于未来,Akshay描绘了一个分阶段的愿景。首先是开发者阶段(已完成),他们愿意容忍more friction来换取powerful capabilities。其次是知识工作者阶段(当前重点),这要求更好的UI、artifacts、computer use等能力,以及"show don't tell"的发现机制——通过内部示例和viral moments(比如那个游戏)让人意识到可能性,而非写教程。最后是"everyone"阶段,即使是在个人生活中也能使用(meal planning、找丢失的包裹等)。关键是不要把这些分割成不同的产品,而是统一的foundation with different affordances。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。