训练大语言模型时,最容易出现的误区是把“规模”简单等同于参数量。实际上,在预算有限的情况下,模型参数、训练数据和计算量彼此制约:参数太多而数据不足,模型学不充分;数据很多而模型太小,容量可能成为瓶颈;两者同时扩大,又会迅速推高训练成本。缩放定律的价值,正是用可测量的经验关系帮助团队寻找更合理的资源组合。
缩放定律究竟描述什么
LLM 缩放定律通常描述训练损失与参数规模、数据规模及训练算力之间近似稳定的幂律关系。简单来说,当其他条件不构成瓶颈时,增加参数、数据或计算量通常都能降低损失,但收益会逐渐递减。Kaplan 等人的研究表明,语言模型损失能够随模型大小、数据量和计算量呈现较平滑的变化趋势,相关结论可参阅原始论文[1]。
这里的关键不是背诵某个固定公式,而是理解三个变量不能彼此孤立。若只扩大模型却不给足训练数据,大量参数无法得到充分更新;若只堆积数据而模型容量有限,新增样本的边际收益也会下降。因此,缩放定律本质上是一种预算分配方法,而不是“参数越大越好”的证明。
先确定算力,再讨论模型规模
项目规划应从可用计算预算出发,而不是先决定一个醒目的参数量。训练计算量通常与参数数量、训练 token 数以及训练方式密切相关。在模型结构和训练流程大体确定后,参数量与 token 数的乘积可以作为估算预训练成本的重要基础,但实际支出还会受到序列长度、批量大小、激活重计算、并行策略、硬件利用率和通信开销影响。
因此,团队应先明确可使用的加速卡数量、训练周期、可接受的失败成本和目标模型版本数,再为超参数试验、数据清洗、正式训练及故障恢复分别预留预算。若把全部资源一次性押在最大模型上,一旦学习率、数据配比或系统配置不合适,纠错成本会非常高。
参数与数据应协同增长
早期缩放研究更强调大模型的样本效率,而 Chinchilla 研究进一步指出,许多大语言模型相对于自身参数量并没有接受足够的数据训练。在固定算力下,更小的模型配合更多训练 token,可能比参数更大但训练不足的模型取得更好效果。该研究通过多组不同规模实验提出,计算最优配置中模型大小和训练 token 数应大致同步扩展,详见Chinchilla 论文[2]及DeepMind 研究说明。
这一结论对工程决策的直接启示是:参数翻倍时,不能默认沿用原来的数据量和训练步数。团队应重新评估有效 token 数、数据重复次数、学习率计划与收敛程度。所谓有效 token,不只是文件中 token 的总和,还应扣除重复文本、低质量内容、模板噪声和可能造成能力偏置的数据。
用小规模实验拟合自己的曲线
公开研究提供的是方法和参考趋势,并不保证适用于所有语言、领域和模型结构。中文模型、代码模型、行业模型及多模态模型的数据分布不同,直接照搬其他项目的比例可能产生较大偏差。更稳妥的方式是先训练一组小型模型,系统改变参数量、token 数和计算预算,记录验证损失与关键任务指标。
- 建立实验矩阵:选择多个参数档位,并为每个档位设置不同的数据量和训练步数。
- 统一评测条件:保持分词器、验证集、优化器及主要数据配比尽量一致,避免把流程差异误判为规模收益。
- 拟合趋势:观察验证损失随参数、数据和算力的变化,估计边际收益开始明显下降的位置。
- 外推后留出余量:大规模训练可能遭遇吞吐下降、数值不稳定和数据污染,预算不能只按理论计算量安排。
从“训练最优”转向“全生命周期最优”
计算最优并不一定等于商业最优。参数更小、训练更久的模型,往往需要更多预训练数据处理,却可能明显降低后续推理成本。对于调用量大的在线服务,推理延迟、显存占用和单位请求成本可能比一次性训练费用更重要;对于只训练一次、调用次数较少的科研模型,团队则可能更关注训练阶段的性能上限。
因此,资源分配至少应同时考虑预训练成本、微调成本、推理吞吐、上下文长度、部署硬件和未来扩展需求。若业务允许,还可把蒸馏、量化、稀疏化或混合专家结构纳入评估,但这些技术会改变容量与计算量之间的关系,需要重新进行实验验证。
实践中容易忽视的限制
- 损失不等于全部能力:验证损失下降通常是积极信号,但不能完全代表事实性、推理能力、安全性和具体业务效果。
- 数据质量会改变曲线:高质量、去重良好的数据可能比简单增加原始 token 更有效。
- 分布变化会削弱外推:小模型上的最佳数据配比不一定原样适用于更大规模。
- 硬件效率影响真实预算:理论浮点运算量相同,不代表训练时间、电力成本和设备利用率相同。
- 定律具有适用区间:缩放关系是经验规律,不应被视为跨架构、跨数据集永远成立的自然常数。
总结
LLM 缩放定律提供了一套比“盲目增加参数”更可靠的规划思路:先锁定可承受的计算预算,再通过小规模实验估计参数与数据的联合收益,最终选择既能充分训练、又符合部署成本的模型。真正有效的资源分配,不是追求最大的参数数字,而是在参数容量、有效数据、训练算力和长期推理成本之间找到可验证、可复现且适合业务目标的平衡点。