小心Scaling Laws的那些坑 | Lilian Weng | 不可约损失 | 幂律关系 | VC维度 | Chinchilla | 流形维度假说 | 过拟合惩罚 | 缩放定律
三句話摘要
大模型训练中的缩放定律发展历程、经典争议与现实应用陷阱。 缩放定律是业界最强大的规模与性能预测工具,但其拟合和应用充满了陷阱,细节决定指数,外推距离决定可信度。 幂律是经验规律而非必然:从1992年阿玛里的理论推导到2020年开放AI卡普兰团队的系统实验,缩放定律经历了从理论假设到行业共识的过程。核心发现是损失、参数量、数据量、计算量之间都遵循幂律关系,指数由问题本身决定,与架构无关。
重點整理
重點- 1
幂律是经验规律而非必然:从1992年阿玛里的理论推导到2020年开放AI卡普兰团队的系统实验,缩放定律经历了从理论假设到行业共识的过程。核心发现是损失、参数量、数据量、计算量之间都遵循幂律关系,指数由问题本身决定,与架构无关。
- 2
参数堆积vs数据堆积的核心分歧:卡普兰建议固定算力下应优先增加模型参数(0.73次方),而齐齐拉通过更严格的实验设计证明参数与数据应等比例增长(都是0.5次方)。齐齐拉用700亿参数的Chinchilla模型全面超越2800亿参数的Gopher,说服了整个行业改变训练策略。
- 3
规模与上下文的相对性:两项经典研究看似矛盾,实际上在各自的规模范围内都是正确的。卡普兰在小模型区间(700M-1.5B参数)测得的局部指数偏高,而齐齐拉覆盖更大范围(7000W-160B参数),加入层参数统计方式不同是主要原因。
- 4
数据质量与重复衰减问题:高质量独特数据严重不足后,重复训练会导致模型性能反弹(双下降现象)。2023年穆尼霍夫团队与2026年洛夫莱斯团队分别提出有效数据量折算和过参数化惩罚项,揭示重复数据对大模型伤害更大,权重衰减可部分抵消其副作用。
實用技巧與重點
乾貨- 关键研究与发现:
- 1992年:阿玛里推导四类学习曲线,全部符合幂律形式
- 2017年:赫斯特内斯跨四个领域验证泛化误差与规模的幂律关系
- 2020年:OpenAI卡普兰团队(模型参数7亿到150亿)
- 计算最优分配:N ~ C^0.73,D ~ C^0.27
- 总FLOPS公式:C = 6NE(N为参数,E为训练token数)
- 建议:算力翻10倍 → 模型翻5.5倍,token翻1.8倍
- 2022年:丁麦霍夫曼团队"齐齐拉缩放定律"(测试400+模型,参数7000万到160亿)
- 计算最优分配:N ~ C^0.5,D ~ C^0.5(1:1等比例)
- 实验验证:Chinchilla(700亿参数)vs Gopher(2800亿参数)
- Chinchilla参数仅1/4,训练token多4倍
- 全面超越Gopher性能
- 2022年:艾尔南德斯团队数据重复双下降现象
- 2023年:穆尼霍夫团队有效数据量 = 独特token × (1+重复次数)^(-α)
- 2024年:贝希·罗格鲁团队指出齐齐拉方法三的工程缺陷
- 损失缩放问题(平均vs求和)
- 指数仅保留两位小数导致偏差放大
- 2026年:洛夫莱斯团队显式过参数化惩罚项 = f(重复次数, N/D比例)
- 发现:模型越大对数据重复越敏感
- 权重衰减可显著降低重复数据的伤害
- 工程细节影响:
- 损失精度:四位 vs 两位小数→指数不同
- 损失噪声:千分之一测量误差→结果飘移
- 参数统计:是否包含嵌入层→指数相差显著
- 拟合区间:小模型区间 vs 全区间→指数天差地别
結論
結論“缩放定律是业界最强大的规模与性能预测工具,但其拟合和应用充满了陷阱,细节决定指数,外推距离决定可信度。”
完整解析
詳細缩放定律是大模型行业最广泛认可的规律,其核心思想源远流长。早在1992年,阿玛里的团队就通过学习理论推导出了损失与数据量之间的幂律关系,虽然基于简单的二分类任务,但为后续实证研究奠定了框架。2017年赫斯特内斯团队跨越云计算、图像分类、机器翻译和语言模型四个领域的大规模实验,进一步证实了这一规律的普遍性,并发现泛化误差随数据量的变化始终是幂律,其指数由问题本身决定,与模型架构关系不大。这为业界提供了一个大胆的启发:只需用小规模的对照实验,就能推算出数十亿美元的大模型训练方案。
真正将缩放定律推向行业共识的是2020年OpenAI卡普兰团队的工作。他们在700万到150亿参数范围内做了系统实验,发现训练损失与模型规模、数据量、计算量都呈完美的幂律关系,并得出一个对行业影响深远的结论:在固定计算预算下,最优的参数量应与计算量的0.73次方成正比,数据量与计算量的0.27次方成正比。也就是说,当算力翻10倍时,应该把模型扩大5.5倍,而训练数据只需翻1.8倍。他们还推导出了业界至今仍在使用的FLOPS公式:总计算量≈6×参数量×训练token数。这个公式简洁有力,成为了所有人做算力规划的起点。
然而,仅仅两年后,丁麦的霍夫曼团队提出的"齐齐拉缩放定律"彻底推翻了这一结论。他们在7000万到160亿参数的范围内测试了400多个模型,覆盖更宽阔的规模,采用了三种不同的验证方法,得出了截然相反的结论:参数量和训练token数都应与计算量的0.5次方成正比,也就是说应该等比例地增加。为了验证这个结论,他们用与Gopher完全相同的计算预算训练了Chinchilla模型,参数规模仅为前者的1/4,但训练token数增加了4倍,结果在所有评测上全面超越了Gopher。这一结果引发了业界地震,大家开始疯狂堆数据,不再盲目追求参数规模。
那么两项严谨的实证研究为何结论相反呢?2024年的皮尔斯和松的工作揭示了真相。首先,卡普兰的实验主要在小模型区间(700M-1.5B)进行,而齐齐拉覆盖更宽广的范围,在对数坐标上即使只差一点点,外推到大规模时也会被放大。更关键的是参数统计方式的差异:卡普兰排除了嵌入层参数,而齐齐拉算的是总参数。在小模型中嵌入层占比很高,这导致卡普兰测出的局部指数偏高(0.73),而当模型变大时,嵌入层占比下降,指数逐渐收敛到齐齐拉的0.5。说白了,两个结论都是对的,只是各自在自己的测试范围内有效,不能简单外推。
除了规模问题,近几年最严峻的挑战来自数据质量危机。高质量独特数据急剧稀缺,行业不得不面对数据重复的问题。2022年艾尔南德斯团队的研究发现,数据重复会导致一个诡异的"双下降"现象:损失先下降,然后反弹到一个平台期,最后才继续下降。这表明模型在死机应备重复的数据,反而损害了泛化能力。后来2023年穆尼霍夫团队和2026年洛夫莱斯团队分别提出了修正模型,将有效数据量纳入缩放定律框架。最新的发现是,模型越大对数据重复越敏感,伤害越大,但通过调整权重衰减等正则化手段可以显著减轻这种伤害。然而,这些修正模型基本都是纯经验拟合,缺乏深层的理论解释。
最后,容易被忽视但至关重要的是,缩放定律的拟合本身充满了陷阱。看似微不足道的细节——损失精度、噪声水平、参数统计方式、拟合区间的选择——都会对最终的指数估计产生巨大影响。贝希·罗格鲁团队甚至发现齐齐拉原始数据中因为优化器损失缩放和精度舍入的问题,方法三的结果与其他两个方法略有偏差。这提示我们,缩放定律虽然强大,但它本质上只是一个经验外推工具,使用时必须了解其假设前提和适用边界,不能无限制地外推到未知领域。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


