Codex from 0 to 10M Users: Building ChatGPT Work — Akshay Nathan, OpenAI
三句話摘要
OpenAI产品负责人深度解析ChatGPT Work推出的产品演进与未来愿景。 AI时代的生产力不再由工具决定,而由目标的清晰度和验证反馈的紧密度决定——区分motion和progress,精确定义成功样子,是管理者和product leader最紧急的任务。 产品合并的核心动机:内部观察发现Codex的能力对非开发者同样强大,员工为能使用这类工具感到骄傲。这启发了一个关键问题:如何将这种"超能力"推向ChatGPT的数亿用户?答案是统一产品而非分割,让用户自由选择而非被强制分类。
重點整理
重點- 1
产品合并的核心动机:内部观察发现Codex的能力对非开发者同样强大,员工为能使用这类工具感到骄傲。这启发了一个关键问题:如何将这种"超能力"推向ChatGPT的数亿用户?答案是统一产品而非分割,让用户自由选择而非被强制分类。
- 2
架构统一、体验差异化的设计:底层harness完全相同,确保两个产品都能获得最新的agents、artifacts、plugins等能力。但在UX层面做出不同权衡:ChatGPT优化延迟与对话流畅性(搜索、学习),ChatGPT Work则突出diff展示、代码可见性、沙箱安全等。这体现了"不想让用户被限制在某个tab里"的产品哲学。
- 3
多阶段扩展战略:开发者(早期采用)→知识工作者(财务、营销等全职能)→所有人(包括个人生活中的生产力)。每个阶段都应用前一阶段的学习,逐步降低使用摩擦。当前重点是让"不知道自己能用AI做什么"的人看到实际例子,而非告诉他们——让产品自己说话。
- 4
生产力测量的本质:放弃用代码行数、story points这类代理指标,转向直接问"用户是否在朝目标进展?"。内部衡量标准是"at bats"质量——团队能否高效完成从想法→构建→反馈→迭代的闭环。这要求管理者对"成功长什么样"有精确定义,否则容易把motion(看起来在做东西)误当成progress(真实朝目标推进)。
實用技巧與重點
乾貨- 用户规模与时间线
- ChatGPT Work推出时:10 million users
- 两周内增长至:100+ million users
- 产品与模式名称
- ChatGPT(经典harness)—— 延迟优化、对话为中心
- Codex harness —— computer environment、agents、artifacts、plugins为中心
- ChatGPT Work —— 知识工作场景的统一体验
- o1-mini 和 o1 —— 推理模型,默认用o1-mini(成本与速度的平衡)
- Claude Opus/Sonnet —— 可作为sub-agents使用的替代模型
- 核心功能清单
- Artifacts:可实时编辑的Excel、PowerPoint、Docs、Sites
- Computer use:agent可直接操作用户计算机环境
- Plugins和MCP:连接外部数据源(财务应用、日历、Slack等)
- Memory v3:跨对话持久化用户背景,自动继承到ChatGPT Work
- Chronicle(实验性):自动监听用户电脑活动,生成更深层的memory
- Sub-agents:支持并行任务执行和成本优化(小模型处理搜索等)
- Speed/Quality slider:单维度投影(延迟 ↔ 深度),默认用o1-mini
- 具体案例的关键数据
- 游戏设计:30张照片 → 7亿代币 → 完整3D游戏网页 + 自对弈AI训练系统
- 退休计算器:可编辑的Excel式表格(无需Excel许可证)
- Sites作为研究输出:替代Markdown,提供更高的可视化信息带宽
- 公司财务报告:从PPT/Excel转向Sites,提升团队协作效率
- 评审收集:从Slack、代码、文档等多源自动聚合员工背景
- 产品决策与原则
- 不强制分离体验,用户可自由切换(由model router智能判断何时进入Work模式)
- 默认配置应该对多数人最优,高级用户可通过Advanced menu调整
- 显示足够信息让用户验证过程(不完全黑盒),但避免overwhelming
- Chronicle默认关闭但可启用,自动学习用户工作模式
- 权限模型需慎重(如多人协作时,谁能看到artifacts?)
結論
結論“AI时代的生产力不再由工具决定,而由目标的清晰度和验证反馈的紧密度决定——区分motion和progress,精确定义成功样子,是管理者和product leader最紧急的任务。”
完整解析
詳細这场访谈捕捉了OpenAI核心产品团队对"如何让AI能力惠及更广泛人群"这一长期问题的最新答案。Akshay的职业轨迹很关键——他曾在Walrus(无代码自动化)、Airtable(低代码数据库)和OpenAI企业部工作,这些经历都围绕同一个信念:让普通人能够使用曾经只有工程师才能掌握的超能力。LLMs到来时,这个愿景终于有了缺失的技术基础。
ChatGPT Work的推出故事始于一个内部观察。当Codex发布时,Akshay在内部UXR(用户研究)会议上发现了一个令人惊讶的现象:非技术部门(财务、市场营销等)的员工都开始使用Codex,更令人印象深刻的是他们为此感到骄傲——"我不应该能用这个,但我在用",这种自豪感源于他们获得了原本属于开发者的"超能力"。这启发了一个关键的产品问题:为什么要限制这种能力只给开发者?如何将其推向ChatGPT数亿用户中不知道他们能做什么的人?
产品架构上,OpenAI做了一个聪明的决定:统一底层技术(harness),但在UI/UX层面保持区分。具体来说,ChatGPT和ChatGPT Work共享同一个计算引擎——同样的agents系统、同样的artifacts能力、同样的plugins连接。这意味着两个产品都能实时获得最新的能力。但他们在用户面向的设计上做了有针对性的权衡:Classic ChatGPT因为需要优化延迟、个性化和对话流畅性,所以对artifacts的细节展示更少(保持对话聚焦);ChatGPT Work则完全相反,积极展示代码diff、计算过程、所有的中间步骤——因为知识工作者需要验证agent的推理过程。这种设计来自一个深刻的洞察:现代工作的边界已经模糊了,一个人在一天内可能会从写代码切换到制作财务报告、再切换到规划营销活动。强行用"这是给开发者的"或"这是给非开发者的"来分割产品,违背了AI正在改变的现实。
在功能层面,一些创新尤其值得关注。Artifacts系统让AI不再只输出代码片段,而是完整的可编辑HTML(Sites)、Excel表格、PowerPoint演示。其中Sites尤其有趣——虽然Twitter上很多人吹捧它作为"原型工具",但Akshay指出一个更重要的用法:Sites本身成为了知识工作的一个新的输出格式。他提到公司财务团队现在用Sites替代月度报告中的PPT和Excel——不是因为Sites更漂亮,而是因为当你有无限灵活的HTML canvas和一个能够理解意图的AI时,信息组织和更新的成本大幅下降。访谈嘉宾展示了一个游戏设计的例子:他用30张手机照片、一个简单的prompt,ChatGPT Work花了7亿个tokens生成了一个完整的可玩网页游戏,包含3D块级放置逻辑和自对弈的AI训练框架。这在一年前是完全不可想象的工作量。
Memory系统是另一个战略性的设计。新的Memory v3和实验性的Chronicle功能让AI能够跨多个对话持久化对用户的理解。特别是Chronicle——它自动学习用户在电脑上做什么,识别patterns——提供了更深层的背景。这在ChatGPT Work中尤其强大,因为所有新对话默认继承用户的memory,使得从ChatGPT切换到Work感觉像是一个自然的延续而非迁移。Akshay说有人甚至看到自己的memory档案时感到惊讶——"我都忘了我做过这个,但记录在这里"——这说明memory不只是记录,还能主动表面隐藏的价值。
关于模型选择,OpenAI的策略是"good defaults, power user options"。他们为Speed/Quality设计了一个单维度滑块(底层是o1-mini到o1的映射),绝大多数人应该用默认配置。但对于那些想要构建可复用工作流的人,可以在Advanced设置中手动调整models、reasoning effort、sub-agent模型等。这里有个有趣的观察:许多power users会告诉模型"用sub-agents"来优化成本和延迟,而Sonnet/Opus的组合(用Sonnet做小任务)被证明既便宜又快。
核心的生产力测量框架也有重大转变。传统的proxy metrics(代码行数、story points)在AI时代开始失效,因为你可能用一个prompt完成原本需要100行代码的工作。Akshay提出的替代方案是"at bats"——衡量团队能否高效地执行从"产生想法→快速构建→收集反馈→基于反馈迭代→验证假设→进入下一个周期"这样的完整循环。这要求管理者非常清晰地定义成功样子,否则很容易把"看起来在做东西"(motion)误当成"真的在朝目标推进"(progress)。这个区别至关重要,因为AI让motion变得极其廉价,任何人都可以迅速生成很多东西,但那些东西中有多少真的推进了目标?
关于未来,Akshay描绘了一个分阶段的愿景。首先是开发者阶段(已完成),他们愿意容忍more friction来换取powerful capabilities。其次是知识工作者阶段(当前重点),这要求更好的UI、artifacts、computer use等能力,以及"show don't tell"的发现机制——通过内部示例和viral moments(比如那个游戏)让人意识到可能性,而非写教程。最后是"everyone"阶段,即使是在个人生活中也能使用(meal planning、找丢失的包裹等)。关键是不要把这些分割成不同的产品,而是统一的foundation with different affordances。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


