本文系统梳理大模型 Scaling Laws 的研究脉络,从早期机器学习损失可预测性、Kaplan 与 Chinchilla 的计算最优分配,到数据受限区域及实际拟合中的敏感陷阱,为理解缩放定律提供了全面且深入的导览。
📝 详细摘要
文章由翁荔(Lilian Weng)2026 年 6 月发表的博客翻译而来,是其“Scaling Laws, Carefully”一文的完整中译。作者从早期机器学习损失的可预测性讲起,回顾了 Amari 等人的四种学习曲线理论、Hestness 等人的经验幂律发现,以及 Rosenfeld 等人将误差建模为模型规模与数据规模的联合函数。随后深入分析 Kaplan et al.(2020)的经典缩放定律,指出其“模型规模增长快于数据”的结论与 Chinchilla 论文(Hoffmann et al., 2022)的分歧,并解释分歧来源:小模型区域中 embedding 参数占比不可忽略、实验规模差异等。文章进一步探讨数据受限场景下的缩放定律,介绍 Hernandez 等人关于数据重复的双下降现象、Muennighoff 等人和 Lovelace 等人对数据受限训练的修正建模。最后重点警示实践中拟合缩放定律的棘手之处,以 Besiroglu 等人对 Chinchilla 方法 3 的复制研究为例,展示损失精度、噪声和拟合区域选择如何导致预测的显著偏差,并附带交互式 Toy simulation 说明。全文引用了 15 篇参考文献,结构清晰、论证严谨,是大语言模型缩放定律领域不可多得的系统性综述。
💡 主要观点
- 缩放定律的核心是模型规模、数据量和计算量之间的幂律关系,是深度学习中最关键的经验发现之一。 训练损失会随着模型参数、数据集 token 数和总计算量的增加按幂律下降,在 log-log 图上表现为直线,这一规律可用于预测更大规模模型的性能。
💬 文章金句
- 缩放定律是深度学习中最关键的经验发现之一。
- Kaplan et al. 的结论是“模型增长快于数据”(),Chinchilla 的结论是“每当模型规模翻倍,训练 token 数也应该翻倍”()。
- 尽管缩放定律形式干净,但在实践中,拟合缩放定律可能会对看似琐碎的流程选择出乎意料地敏感。
📊 文章信息
AI 初评:92
来源:AINLP
作者:AINLP
分类:人工智能
语言:中文
阅读时间:34 分钟
字数:8489
标签: 缩放定律, 大语言模型, 模型训练, 数据规模, 计算优化