
扩展法则Scaling Laws可以理解为大模型领域的“黄金法则”。它揭示了模型的性能与模型规模、数据量和计算资源之间遵循一种可预测的幂律关系。简单来说就是只要同步扩大这三个要素模型的能力就会稳定提升。这项发现为大模型的持续膨胀提供了理论依据也是GPT系列能够不断突破的关键。下面我们来梳理这个法则的核心内容与最新发展。OpenAI与DeepMind的里程碑扩展法则的研究最早由OpenAI和DeepMind奠定基础它们提出了两个核心公式研究团队关键洞察通俗理解OpenAI (Kaplan等人, 2020)当计算量提升时应更大比例地投入到扩大模型规模上例如计算量翻10倍模型规模应扩大约5.5倍。模型为王在计算资源有限时优先把预算花在建一个更大的脑子上。DeepMind (Chinchilla团队, 2022)模型规模和数据量应等比例放大。他们据此训练了比GPT-3小但性能更优的Chinchilla模型。均衡饮食大脑变大了也需要同样多的数据食物来喂养否则会营养不良过拟合。扩展法则的演进经典的扩展法则主要针对的是密集Dense模型即每个任务都激活全部参数。但随着模型越来越大训练成本激增稀疏Sparse模型成为新的主流。最典型的代表就是混合专家模型MoE。对于MoE这类稀疏模型扩展法则需要考虑更多因素变得更加复杂影响因素增多除了总参数量 还需要考虑激活参数量每个Token实际使用的参数、专家数量、稀疏度等。最优配置变化研究表明随着模型总规模的增大最优的激活参数量比例会变得越来越稀疏以追求更高的效率。此外最新的研究也在探索新的维度。例如动力学扩展定律发现在推理阶段性能瓶颈不再是参数量而是注意力机制的计算成本。通过引入稀疏注意力可以在相同资源下支持更长的文本生成将问题解决率提升高达60% -3。还有研究提出了并行扩展定律ParScale通过并行计算路径来提升模型能力效率比单纯扩大参数量更高。 反思与未来扩展法则会失效吗随着DeepSeek等模型以更低的成本实现强大性能业界开始重新审视越大越好的信条。扩展法则是否已撞上数据墙数据墙与边际递减高质量的公网文本数据是有限的这成为继续扩大规模的主要瓶颈。单纯增加参数性能提升可能开始边际递减。从规模到密度清华大学和面壁智能团队提出的密度法则指出大模型的能力密度正以指数级速度增长约每3.5个月翻一倍。这意味着未来的方向可能不再是盲目追求更大的块头而是追求更高的密度——用更精炼的参数实现更强的智能。迈向世界模型下一个突破点或许不是继续堆砌语言数据而是让模型学习世界的因果规律即构建世界模型。届时扩展的维度将从文字预测转向模拟现实的逼真度和准确性。总结总的来说经典的扩展法则指导了过去几年大模型的野蛮生长证明了规模的力量。而现在我们正处在一个新的十字路口一方面对稀疏模型、推理阶段的新扩展法则的研究正在深化另一方面对模型密度和世界模型的探索预示着后扩展法则时代的多样性可能。