KeyFrame內部研究專用

小心Scaling Laws的那些坑 | Lilian Weng | 不可约损失 | 幂律关系 | VC维度 | Chinchilla | 流形维度假说 | 过拟合惩罚 | 缩放定律

Best Partners TV·7月1日週三·15 min中文

三句話摘要

大模型训练中的缩放定律发展历程、经典争议与现实应用陷阱。 缩放定律是业界最强大的规模与性能预测工具,但其拟合和应用充满了陷阱,细节决定指数,外推距离决定可信度。 幂律是经验规律而非必然:从1992年阿玛里的理论推导到2020年开放AI卡普兰团队的系统实验,缩放定律经历了从理论假设到行业共识的过程。核心发现是损失、参数量、数据量、计算量之间都遵循幂律关系,指数由问题本身决定,与架构无关。

重點整理

重點
  • 1

    幂律是经验规律而非必然:从1992年阿玛里的理论推导到2020年开放AI卡普兰团队的系统实验,缩放定律经历了从理论假设到行业共识的过程。核心发现是损失、参数量、数据量、计算量之间都遵循幂律关系,指数由问题本身决定,与架构无关。

  • 2

    参数堆积vs数据堆积的核心分歧:卡普兰建议固定算力下应优先增加模型参数(0.73次方),而齐齐拉通过更严格的实验设计证明参数与数据应等比例增长(都是0.5次方)。齐齐拉用700亿参数的Chinchilla模型全面超越2800亿参数的Gopher,说服了整个行业改变训练策略。

  • 3

    规模与上下文的相对性:两项经典研究看似矛盾,实际上在各自的规模范围内都是正确的。卡普兰在小模型区间(700M-1.5B参数)测得的局部指数偏高,而齐齐拉覆盖更大范围(7000W-160B参数),加入层参数统计方式不同是主要原因。

  • 4

    数据质量与重复衰减问题:高质量独特数据严重不足后,重复训练会导致模型性能反弹(双下降现象)。2023年穆尼霍夫团队与2026年洛夫莱斯团队分别提出有效数据量折算和过参数化惩罚项,揭示重复数据对大模型伤害更大,权重衰减可部分抵消其副作用。

實用技巧與重點

乾貨
  • 关键研究与发现:
  • 1992年:阿玛里推导四类学习曲线,全部符合幂律形式
  • 2017年:赫斯特内斯跨四个领域验证泛化误差与规模的幂律关系
  • 2020年:OpenAI卡普兰团队(模型参数7亿到150亿)
  • 计算最优分配:N ~ C^0.73,D ~ C^0.27
  • 总FLOPS公式:C = 6NE(N为参数,E为训练token数)
  • 建议:算力翻10倍 → 模型翻5.5倍,token翻1.8倍
  • 2022年:丁麦霍夫曼团队"齐齐拉缩放定律"(测试400+模型,参数7000万到160亿)
  • 计算最优分配:N ~ C^0.5,D ~ C^0.5(1:1等比例)
  • 实验验证:Chinchilla(700亿参数)vs Gopher(2800亿参数)
  • Chinchilla参数仅1/4,训练token多4倍
  • 全面超越Gopher性能
  • 2022年:艾尔南德斯团队数据重复双下降现象
  • 2023年:穆尼霍夫团队有效数据量 = 独特token × (1+重复次数)^(-α)
  • 2024年:贝希·罗格鲁团队指出齐齐拉方法三的工程缺陷
  • 损失缩放问题(平均vs求和)
  • 指数仅保留两位小数导致偏差放大
  • 2026年:洛夫莱斯团队显式过参数化惩罚项 = f(重复次数, N/D比例)
  • 发现:模型越大对数据重复越敏感
  • 权重衰减可显著降低重复数据的伤害
  • 工程细节影响:
  • 损失精度:四位 vs 两位小数→指数不同
  • 损失噪声:千分之一测量误差→结果飘移
  • 参数统计:是否包含嵌入层→指数相差显著
  • 拟合区间:小模型区间 vs 全区间→指数天差地别

結論

結論

缩放定律是业界最强大的规模与性能预测工具,但其拟合和应用充满了陷阱,细节决定指数,外推距离决定可信度。

完整解析

詳細

缩放定律是大模型行业最广泛认可的规律,其核心思想源远流长。早在1992年,阿玛里的团队就通过学习理论推导出了损失与数据量之间的幂律关系,虽然基于简单的二分类任务,但为后续实证研究奠定了框架。2017年赫斯特内斯团队跨越云计算、图像分类、机器翻译和语言模型四个领域的大规模实验,进一步证实了这一规律的普遍性,并发现泛化误差随数据量的变化始终是幂律,其指数由问题本身决定,与模型架构关系不大。这为业界提供了一个大胆的启发:只需用小规模的对照实验,就能推算出数十亿美元的大模型训练方案。

真正将缩放定律推向行业共识的是2020年OpenAI卡普兰团队的工作。他们在700万到150亿参数范围内做了系统实验,发现训练损失与模型规模、数据量、计算量都呈完美的幂律关系,并得出一个对行业影响深远的结论:在固定计算预算下,最优的参数量应与计算量的0.73次方成正比,数据量与计算量的0.27次方成正比。也就是说,当算力翻10倍时,应该把模型扩大5.5倍,而训练数据只需翻1.8倍。他们还推导出了业界至今仍在使用的FLOPS公式:总计算量≈6×参数量×训练token数。这个公式简洁有力,成为了所有人做算力规划的起点。

然而,仅仅两年后,丁麦的霍夫曼团队提出的"齐齐拉缩放定律"彻底推翻了这一结论。他们在7000万到160亿参数的范围内测试了400多个模型,覆盖更宽阔的规模,采用了三种不同的验证方法,得出了截然相反的结论:参数量和训练token数都应与计算量的0.5次方成正比,也就是说应该等比例地增加。为了验证这个结论,他们用与Gopher完全相同的计算预算训练了Chinchilla模型,参数规模仅为前者的1/4,但训练token数增加了4倍,结果在所有评测上全面超越了Gopher。这一结果引发了业界地震,大家开始疯狂堆数据,不再盲目追求参数规模。

那么两项严谨的实证研究为何结论相反呢?2024年的皮尔斯和松的工作揭示了真相。首先,卡普兰的实验主要在小模型区间(700M-1.5B)进行,而齐齐拉覆盖更宽广的范围,在对数坐标上即使只差一点点,外推到大规模时也会被放大。更关键的是参数统计方式的差异:卡普兰排除了嵌入层参数,而齐齐拉算的是总参数。在小模型中嵌入层占比很高,这导致卡普兰测出的局部指数偏高(0.73),而当模型变大时,嵌入层占比下降,指数逐渐收敛到齐齐拉的0.5。说白了,两个结论都是对的,只是各自在自己的测试范围内有效,不能简单外推。

除了规模问题,近几年最严峻的挑战来自数据质量危机。高质量独特数据急剧稀缺,行业不得不面对数据重复的问题。2022年艾尔南德斯团队的研究发现,数据重复会导致一个诡异的"双下降"现象:损失先下降,然后反弹到一个平台期,最后才继续下降。这表明模型在死机应备重复的数据,反而损害了泛化能力。后来2023年穆尼霍夫团队和2026年洛夫莱斯团队分别提出了修正模型,将有效数据量纳入缩放定律框架。最新的发现是,模型越大对数据重复越敏感,伤害越大,但通过调整权重衰减等正则化手段可以显著减轻这种伤害。然而,这些修正模型基本都是纯经验拟合,缺乏深层的理论解释。

最后,容易被忽视但至关重要的是,缩放定律的拟合本身充满了陷阱。看似微不足道的细节——损失精度、噪声水平、参数统计方式、拟合区间的选择——都会对最终的指数估计产生巨大影响。贝希·罗格鲁团队甚至发现齐齐拉原始数据中因为优化器损失缩放和精度舍入的问题,方法三的结果与其他两个方法略有偏差。这提示我们,缩放定律虽然强大,但它本质上只是一个经验外推工具,使用时必须了解其假设前提和适用边界,不能无限制地外推到未知领域。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。