KeyFrame內部研究專用

Astra会证明定理,却维护不了项目 | 14.8%通过率:数学神话的另一面

Why QQ·8月7日週五·14 min中文

三句話摘要

OpenAI 的数学成果代表 AI 起飞的开始,还是揭示了通向 AGI 的真实障碍?这支影片厘清了这场争论背后的两个不同问题。 模型能力在涨是真的,泛化问题也是真的——工程师的工作不是占卜 AGI 何时来,而是在局部最优的边界内造出可靠系统,把信任拆成可验证的小块。 数学成果的真实分量:每项结果都可机器逐行检验,不同于去年虚假新闻事件。包括首个有限简单群的显示构造和推翻 80 年的单位距离猜想。这证明了模型在可验证领域确实有突破,但这种能力受限于有"完美裁判"的领域。

重點整理

重點
  • 1

    数学成果的真实分量:每项结果都可机器逐行检验,不同于去年虚假新闻事件。包括首个有限简单群的显示构造和推翻 80 年的单位距离猜想。这证明了模型在可验证领域确实有突破,但这种能力受限于有"完美裁判"的领域。

  • 2

    幸存者偏差的陷阱:数学和代码恰好是最容易自动验证的两个领域,有编译器、形式化证明器等铁面判卷者。其他领域没有好的验证器,进步自动不上头条,导致人们被媒体报道误导,以为 AI 全面起飞。

  • 3

    长期工程任务中的快速退化:SCBench 基准的真实数据最为扎心——代码结构在 77% 的轨迹里持续变差,复杂度是人类项目的 2.3 倍,腐化速度快 5-7 倍。根本原因是强化学习的奖励分配太粗糙(一个小错和完全胡说八道拿同分),加上灾难性遗忘导致模型每次修改都在背叛之前的决策。

  • 4

    两方都在说实话,但回答不同问题:起飞派证明的是前沿能力在涨、价格在跳水;冷水派证明的是这些能力泛化不到实际工程。对工程师真正关键的第三个问题是:怎么在能力不稳定的年代造出可靠系统。

實用技巧與重點

乾貨
  • 数学成果
  • 首个有限简单群的显示构造
  • 推翻 80 年的单位距离猜想
  • Token 成本(按 API 价格):约 2000 美元
  • SCBench 基准数据
  • 36 道题、196 个 checkpoint
  • GPT-5.5 严格通过率:14.8%(isolated 模式 28.1%)
  • 代码腐化度:人类项目的 5-7 倍
  • 代码复杂度:473 个开源 Python 仓库平均的 2.3 倍
  • 典型案例:OPOS 4.7 某题函数从 38 行膨胀到 240 行
  • 新模型(GPT-5.6、Fable 5K3):通过率翻倍,但无单次完整清洁运行
  • 能力增长曲线(Meter 数据)
  • 2019-2025:每 196 天翻倍
  • 2023 年后加速:每 131 天翻倍
  • 限制:仅衡量 50% 和 80% 可靠度,99% 可靠度无法推断 16+ 小时任务
  • 层次边界现象
  • BCG 758 名顾问实验:边界内任务 AI 快 25%、质量更高;边界外复杂任务正确率低 19%
  • 特征:输出看起来完整流畅,用户难以察觉已越界
  • 8 条工程落地方案
  • 前四条(管流程):
  • 长任务分拆:Anthropic 双智能体方案(Initializer 展开需求 → Encoder 增量工作)
  • 完成条件外部化:写成可测文件防止中途重新定义
  • 生成与评估分离:模型打分永远偏宽松,需隔离评估器
  • EVO 二值化:只查一种失败模式,优先用确定性检查而非 LM Judge
  • 后四条(管分寸):
  • 人在回路:不可逆动作强制人工批准,Policy 在 LLM 外强制执行
  • Meter 任务时程:用人类专家时间标定难度,而非 AI 连续跑时长
  • 定期架构审查:第一个 checkpoint 的人工评审 ROI 最高
  • 个人边界地图:记录每个模型的靠谱与翻车位置,每代模型更新一次

結論

結論

模型能力在涨是真的,泛化问题也是真的——工程师的工作不是占卜 AGI 何时来,而是在局部最优的边界内造出可靠系统,把信任拆成可验证的小块。

完整解析

詳細

讨论的核心是一个看似简单但涉及两个坐标轴的问题:AI 起飞了吗?

起飞派(Andrew Curran)的论据很有说服力——OpenAI 推理效率提升导致降价,模型发布节奏加快,还发了十项数学成果。这些都是真的。但 E.M. Butler(XBROW 的 AI 研究员,去年登上 HackerNews 全球排行第一)发表了一篇 6 万浏览的长文《我们还没有获准起飞》,指出了看似风光背后的真实困局。

先说数学成果的真实性。去年 OpenAI 曾因研究员把既有文献当作破解开放问题引起争议,这次情况不同。每项数学结果都附了机器可验证的形式化证明,可以逐行检验推导。包括首个有限简单群的显示构造和推翻已困扰数学家 80 年的单位距离猜想。数学家 Gauris 评价说"如果投到数学年刊我会建议接收"。Butler 本人也没有否认这些,承认机器确实造出来了,这些可能是通向 AGI 自我改进的零件。

但真正的转折点在这里:零件自己拆不成飞机。Butler 的最锋利一刀砍在"幸存者偏差"上。数学和代码恰好是最容易自动验证的两个领域。答案对错有完美的裁判——编译器、单元测试、形式化证明器。这些东西永远不会被贿赂。其他领域没有好的判卷老师,所以即使模型进步了也不上头条。你天天看头条就觉得全世界都在起飞,这就是幸存者偏差。

更扎实的证据来自威斯康星大学麦迪逊分校的 SCBench 基准。这个基准有 36 道编程问题和 196 个 checkpoint,模拟真实的长期软件项目。智能体需要在自己之前写的代码上持续迭代,应对不断变化的需求。成功的标准很严格:新功能的测试要过,所有历史回归测试也要过。GPT-5.5 在严格口径下的通过率只有 14.8%。即使放松标准到"孤立"模式也只有 28.1%。

最扎心的观察是代码结构的持续退化。在浮华模式的 77% 轨迹里,代码结构在不断变差。生成的代码复杂度是 473 个开源 Python 仓库平均水平的 2.3 倍,腐化速度是人类项目的 5-7 倍。有一个典型案例:OPOS 4.7 在某道题上,一个函数从 38 行代码一路膨胀到 240 行。这不是能力不够,这是实实在在的退化。

问题的机制是什么?主流的后训练方法是强化学习(RL),但现有的奖励分配特别粗糙。以 GRPO 为例,整条 Rollout 跑完只拿一个二值的奖励,平均摊到每一个 token 上。这意味着一个简单的算术错误和完全胡说八道拿的是同一个零分。加上灾难性遗忘——长期强化学习稳不住——三件事叠在一起,模型就没法把过去的决策和当前的决策稳定关联。每一次修改都像在背叛上一次的自己。Butler 的判断是:不解决这些基础问题,模型的能力就泛化不到数学、大部分科学和代码之外的领域。

新模型发布后,有人说那是老模型的问题。Dex Horsey(Humilator 创始人,12Factor Agents 的作者)拿 SCBench 的一个小切片测试了 GPT-5.6 和 Fable 5K3。通过率确实翻倍了。但这是关键的观察:没有任何一次运行能完整、干净地解决哪怕一道题。

所以两方都是对的。起飞派回答的是"前沿能力还在不在涨"(在,而且涨得很猛)。冷水派回答的是"这套学习范式能不能泛化到所有地方"(暂时不能)。他们炒的是两道不同的题。对工程师真正要紧的是第三个问题:在智能还不稳定的年代,怎么造出可靠的系统?

答案不是等 AGI 何时来,而是去画你自己的层次边界地图。Meter 的数据显示模型能力确实在翻倍,但要注意这条曲线只衡量的是软件、机器学习和网络安全等特定领域的成功率。Carpentry 2024 年造的"层次边界"概念解释了真实情况——BCG 做过一个 758 名顾问的实验,在边界内的任务上用 AI 的人快 25%、质量更高;但在边界外特意挑选的复杂任务上,AI 组的正确率反而低了 19 个百分点。最麻烦的是输出看起来照样完整流畅,你很难意识到已经越界了。

工程师能做什么?有 8 条来自一线团队的实践。前四条管流程:第一,长任务别用一个智能体硬扛,Anthropic 公开过双智能体方案,Initializer 先把需求展开,Encoder 每次只做一两个特性的增量工作;第二,开工前把完成条件写成外部可测的文件,防止智能体中途偷偷重新定义完成条件;第三,生成和评估必须分开,因为模型给自己打分永远偏宽松,评估器需要隔离;第四,EVO 做成二值的 PASS 或 FAIL,每个评估只查一种失败模式,能用确定性检查就别用 LM Judge。

后四条管分寸:第五,人在回路按风险分析,不可逆的动作强制人工批准,把策略写成 Policy Code 在 LLM 之外强制执行;第六,学会用 Meter 的任务时程思路来切任务,衡量的不是 AI 能连续跑多久,而是用人类专家完成任务的时间来标定任务难度;第七,定期人工审查,尤其是第一个 checkpoint 的架构评审,投入产出比最高,一旦这块铺好了后面就都稳定了;第八,在自己的真实项目上系统地记录模型在哪靠谱在哪翻车,每换一次模型就更新你的层次边界地图,这张图是你未来几年最值钱的职业资产。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。