← 回總覽

翁荔最新万字长文:大模型 Scaling Laws,要谨慎理解

📅 2026-06-26 14:00 AINLP 人工智能 2 分鐘 1757 字 評分: 92
缩放定律 大语言模型 模型训练 数据规模 计算优化
📌 一句话摘要 本文系统梳理大模型 Scaling Laws 的研究脉络,从早期机器学习损失可预测性、Kaplan 与 Chinchilla 的计算最优分配,到数据受限区域及实际拟合中的敏感陷阱,为理解缩放定律提供了全面且深入的导览。 📝 详细摘要 文章由翁荔(Lilian Weng)2026 年 6 月发表的博客翻译而来,是其“Scaling Laws, Carefully”一文的完整中译。作者从早期机器学习损失的可预测性讲起,回顾了 Amari 等人的四种学习曲线理论、Hestness 等人的经验幂律发现,以及 Rosenfeld 等人将误差建模为模型规模与数据规模的联合函数。随后深入

📌 一句话摘要

本文系统梳理大模型 Scaling Laws 的研究脉络,从早期机器学习损失可预测性、Kaplan 与 Chinchilla 的计算最优分配,到数据受限区域及实际拟合中的敏感陷阱,为理解缩放定律提供了全面且深入的导览。

📝 详细摘要

文章由翁荔(Lilian Weng)2026 年 6 月发表的博客翻译而来,是其“Scaling Laws, Carefully”一文的完整中译。作者从早期机器学习损失的可预测性讲起,回顾了 Amari 等人的四种学习曲线理论、Hestness 等人的经验幂律发现,以及 Rosenfeld 等人将误差建模为模型规模与数据规模的联合函数。随后深入分析 Kaplan et al.(2020)的经典缩放定律,指出其“模型规模增长快于数据”的结论与 Chinchilla 论文(Hoffmann et al., 2022)的分歧,并解释分歧来源:小模型区域中 embedding 参数占比不可忽略、实验规模差异等。文章进一步探讨数据受限场景下的缩放定律,介绍 Hernandez 等人关于数据重复的双下降现象、Muennighoff 等人和 Lovelace 等人对数据受限训练的修正建模。最后重点警示实践中拟合缩放定律的棘手之处,以 Besiroglu 等人对 Chinchilla 方法 3 的复制研究为例,展示损失精度、噪声和拟合区域选择如何导致预测的显著偏差,并附带交互式 Toy simulation 说明。全文引用了 15 篇参考文献,结构清晰、论证严谨,是大语言模型缩放定律领域不可多得的系统性综述。

💡 主要观点

- 缩放定律的核心是模型规模、数据量和计算量之间的幂律关系,是深度学习中最关键的经验发现之一。 训练损失会随着模型参数、数据集 token 数和总计算量的增加按幂律下降,在 log-log 图上表现为直线,这一规律可用于预测更大规模模型的性能。

Kaplan et al.与 Chinchilla 对计算最优分配给出了不同结论,差异源于实验规模和参数定义。 Kaplan 建议模型增长快于数据,Chinchilla 则认为参数和 token 应等比例增长。分歧主要由小模型区域中 embedding 参数占比和非 embedding 参数的局部幂律指数差异造成。
数据受限时,重复数据会导致过拟合,缩放定律需加入有效数据衰减项修正。 Muennighoff 等人和 Lovelace 等人分别提出将重复数据建模为有效 token 数衰减,并引入过拟合惩罚项,从而在有限唯一数据下重新计算最优模型规模。
实际拟合缩放定律对精度、噪声和拟合区域等细节高度敏感,容易产生错误外推。 Besiroglu 等人的复制研究显示,损失值四舍五入、微小噪声以及拟合数据范围的选择都会显著改变拟合参数,导致预测与真实结果偏差很大。

💬 文章金句

- 缩放定律是深度学习中最关键的经验发现之一。

  • Kaplan et al. 的结论是“模型增长快于数据”(),Chinchilla 的结论是“每当模型规模翻倍,训练 token 数也应该翻倍”()。
  • 尽管缩放定律形式干净,但在实践中,拟合缩放定律可能会对看似琐碎的流程选择出乎意料地敏感。

📊 文章信息

AI 初评:92

来源:AINLP

作者:AINLP

分类:人工智能

语言:中文

阅读时间:34 分钟

字数:8489

标签: 缩放定律, 大语言模型, 模型训练, 数据规模, 计算优化

阅读完整文章

查看原文 → 發佈: 2026-06-26 14:00:00 收錄: 2026-06-27 00:00:41

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。