Astra会证明定理,却维护不了项目 | 14.8%通过率:数学神话的另一面
三句話摘要
OpenAI 的数学成果代表 AI 起飞的开始,还是揭示了通向 AGI 的真实障碍?这支影片厘清了这场争论背后的两个不同问题。 模型能力在涨是真的,泛化问题也是真的——工程师的工作不是占卜 AGI 何时来,而是在局部最优的边界内造出可靠系统,把信任拆成可验证的小块。 数学成果的真实分量:每项结果都可机器逐行检验,不同于去年虚假新闻事件。包括首个有限简单群的显示构造和推翻 80 年的单位距离猜想。这证明了模型在可验证领域确实有突破,但这种能力受限于有"完美裁判"的领域。
重點整理
重點- 1
数学成果的真实分量:每项结果都可机器逐行检验,不同于去年虚假新闻事件。包括首个有限简单群的显示构造和推翻 80 年的单位距离猜想。这证明了模型在可验证领域确实有突破,但这种能力受限于有"完美裁判"的领域。
- 2
幸存者偏差的陷阱:数学和代码恰好是最容易自动验证的两个领域,有编译器、形式化证明器等铁面判卷者。其他领域没有好的验证器,进步自动不上头条,导致人们被媒体报道误导,以为 AI 全面起飞。
- 3
长期工程任务中的快速退化:SCBench 基准的真实数据最为扎心——代码结构在 77% 的轨迹里持续变差,复杂度是人类项目的 2.3 倍,腐化速度快 5-7 倍。根本原因是强化学习的奖励分配太粗糙(一个小错和完全胡说八道拿同分),加上灾难性遗忘导致模型每次修改都在背叛之前的决策。
- 4
两方都在说实话,但回答不同问题:起飞派证明的是前沿能力在涨、价格在跳水;冷水派证明的是这些能力泛化不到实际工程。对工程师真正关键的第三个问题是:怎么在能力不稳定的年代造出可靠系统。
實用技巧與重點
乾貨- 数学成果
- 首个有限简单群的显示构造
- 推翻 80 年的单位距离猜想
- Token 成本(按 API 价格):约 2000 美元
- SCBench 基准数据
- 36 道题、196 个 checkpoint
- GPT-5.5 严格通过率:14.8%(isolated 模式 28.1%)
- 代码腐化度:人类项目的 5-7 倍
- 代码复杂度:473 个开源 Python 仓库平均的 2.3 倍
- 典型案例:OPOS 4.7 某题函数从 38 行膨胀到 240 行
- 新模型(GPT-5.6、Fable 5K3):通过率翻倍,但无单次完整清洁运行
- 能力增长曲线(Meter 数据)
- 2019-2025:每 196 天翻倍
- 2023 年后加速:每 131 天翻倍
- 限制:仅衡量 50% 和 80% 可靠度,99% 可靠度无法推断 16+ 小时任务
- 层次边界现象
- BCG 758 名顾问实验:边界内任务 AI 快 25%、质量更高;边界外复杂任务正确率低 19%
- 特征:输出看起来完整流畅,用户难以察觉已越界
- 8 条工程落地方案
- 前四条(管流程):
- 长任务分拆:Anthropic 双智能体方案(Initializer 展开需求 → Encoder 增量工作)
- 完成条件外部化:写成可测文件防止中途重新定义
- 生成与评估分离:模型打分永远偏宽松,需隔离评估器
- EVO 二值化:只查一种失败模式,优先用确定性检查而非 LM Judge
- 后四条(管分寸):
- 人在回路:不可逆动作强制人工批准,Policy 在 LLM 外强制执行
- Meter 任务时程:用人类专家时间标定难度,而非 AI 连续跑时长
- 定期架构审查:第一个 checkpoint 的人工评审 ROI 最高
- 个人边界地图:记录每个模型的靠谱与翻车位置,每代模型更新一次
結論
結論“模型能力在涨是真的,泛化问题也是真的——工程师的工作不是占卜 AGI 何时来,而是在局部最优的边界内造出可靠系统,把信任拆成可验证的小块。”
完整解析
詳細讨论的核心是一个看似简单但涉及两个坐标轴的问题:AI 起飞了吗?
起飞派(Andrew Curran)的论据很有说服力——OpenAI 推理效率提升导致降价,模型发布节奏加快,还发了十项数学成果。这些都是真的。但 E.M. Butler(XBROW 的 AI 研究员,去年登上 HackerNews 全球排行第一)发表了一篇 6 万浏览的长文《我们还没有获准起飞》,指出了看似风光背后的真实困局。
先说数学成果的真实性。去年 OpenAI 曾因研究员把既有文献当作破解开放问题引起争议,这次情况不同。每项数学结果都附了机器可验证的形式化证明,可以逐行检验推导。包括首个有限简单群的显示构造和推翻已困扰数学家 80 年的单位距离猜想。数学家 Gauris 评价说"如果投到数学年刊我会建议接收"。Butler 本人也没有否认这些,承认机器确实造出来了,这些可能是通向 AGI 自我改进的零件。
但真正的转折点在这里:零件自己拆不成飞机。Butler 的最锋利一刀砍在"幸存者偏差"上。数学和代码恰好是最容易自动验证的两个领域。答案对错有完美的裁判——编译器、单元测试、形式化证明器。这些东西永远不会被贿赂。其他领域没有好的判卷老师,所以即使模型进步了也不上头条。你天天看头条就觉得全世界都在起飞,这就是幸存者偏差。
更扎实的证据来自威斯康星大学麦迪逊分校的 SCBench 基准。这个基准有 36 道编程问题和 196 个 checkpoint,模拟真实的长期软件项目。智能体需要在自己之前写的代码上持续迭代,应对不断变化的需求。成功的标准很严格:新功能的测试要过,所有历史回归测试也要过。GPT-5.5 在严格口径下的通过率只有 14.8%。即使放松标准到"孤立"模式也只有 28.1%。
最扎心的观察是代码结构的持续退化。在浮华模式的 77% 轨迹里,代码结构在不断变差。生成的代码复杂度是 473 个开源 Python 仓库平均水平的 2.3 倍,腐化速度是人类项目的 5-7 倍。有一个典型案例:OPOS 4.7 在某道题上,一个函数从 38 行代码一路膨胀到 240 行。这不是能力不够,这是实实在在的退化。
问题的机制是什么?主流的后训练方法是强化学习(RL),但现有的奖励分配特别粗糙。以 GRPO 为例,整条 Rollout 跑完只拿一个二值的奖励,平均摊到每一个 token 上。这意味着一个简单的算术错误和完全胡说八道拿的是同一个零分。加上灾难性遗忘——长期强化学习稳不住——三件事叠在一起,模型就没法把过去的决策和当前的决策稳定关联。每一次修改都像在背叛上一次的自己。Butler 的判断是:不解决这些基础问题,模型的能力就泛化不到数学、大部分科学和代码之外的领域。
新模型发布后,有人说那是老模型的问题。Dex Horsey(Humilator 创始人,12Factor Agents 的作者)拿 SCBench 的一个小切片测试了 GPT-5.6 和 Fable 5K3。通过率确实翻倍了。但这是关键的观察:没有任何一次运行能完整、干净地解决哪怕一道题。
所以两方都是对的。起飞派回答的是"前沿能力还在不在涨"(在,而且涨得很猛)。冷水派回答的是"这套学习范式能不能泛化到所有地方"(暂时不能)。他们炒的是两道不同的题。对工程师真正要紧的是第三个问题:在智能还不稳定的年代,怎么造出可靠的系统?
答案不是等 AGI 何时来,而是去画你自己的层次边界地图。Meter 的数据显示模型能力确实在翻倍,但要注意这条曲线只衡量的是软件、机器学习和网络安全等特定领域的成功率。Carpentry 2024 年造的"层次边界"概念解释了真实情况——BCG 做过一个 758 名顾问的实验,在边界内的任务上用 AI 的人快 25%、质量更高;但在边界外特意挑选的复杂任务上,AI 组的正确率反而低了 19 个百分点。最麻烦的是输出看起来照样完整流畅,你很难意识到已经越界了。
工程师能做什么?有 8 条来自一线团队的实践。前四条管流程:第一,长任务别用一个智能体硬扛,Anthropic 公开过双智能体方案,Initializer 先把需求展开,Encoder 每次只做一两个特性的增量工作;第二,开工前把完成条件写成外部可测的文件,防止智能体中途偷偷重新定义完成条件;第三,生成和评估必须分开,因为模型给自己打分永远偏宽松,评估器需要隔离;第四,EVO 做成二值的 PASS 或 FAIL,每个评估只查一种失败模式,能用确定性检查就别用 LM Judge。
后四条管分寸:第五,人在回路按风险分析,不可逆的动作强制人工批准,把策略写成 Policy Code 在 LLM 之外强制执行;第六,学会用 Meter 的任务时程思路来切任务,衡量的不是 AI 能连续跑多久,而是用人类专家完成任务的时间来标定任务难度;第七,定期人工审查,尤其是第一个 checkpoint 的架构评审,投入产出比最高,一旦这块铺好了后面就都稳定了;第八,在自己的真实项目上系统地记录模型在哪靠谱在哪翻车,每换一次模型就更新你的层次边界地图,这张图是你未来几年最值钱的职业资产。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


