在大模型预训练中,权重衰减系数常被当作一个普通的正则化超参数,但它实际控制的不只是“参数是否过大”。它会持续改变参数范数、方向更新速度和优化器的时间尺度,进而影响训练稳定性、收敛效率以及验证集损失。理解这些联系,有助于减少盲目调参,也能更可靠地把小模型实验结果迁移到更大规模。
一、权重衰减如何进入参数更新
以常用的 AdamW 为例,参数更新可以简化理解为:先根据梯度及其一、二阶矩估计完成自适应更新,再将参数乘以接近“1-学习率×权重衰减系数”的收缩因子。因此,权重衰减系数越大,每一步对旧参数的压缩越强;学习率越高,这种压缩的实际效果也越明显。
这里需要区分 AdamW 的解耦式权重衰减与直接在损失函数中加入 L2 惩罚。对于普通 SGD,两者经过适当缩放可以等价;但在 Adam 等自适应优化器中,L2 项会被逐参数学习率重新缩放,无法形成统一的收缩。AdamW 将衰减与梯度更新分开,因而更容易分析和调节。相关原理可参考 AdamW 原始论文 [1]。
二、参数范数并非只会单调下降
如果没有梯度,权重衰减确实会使参数范数逐步减小。但在真实预训练中,梯度更新不断把参数推向有利于降低损失的方向,而权重衰减则把参数拉回原点附近。参数范数的演化由这两种作用共同决定,通常会经历初始化附近的调整、较快增长以及相对稳定的平台阶段。
当衰减系数过小时,梯度推动可能长期占据主导,部分矩阵的 Frobenius 范数或谱范数持续抬升。参数数值变大并不必然意味着模型马上过拟合,但可能改变残差分支的增益、激活尺度和不同层之间的更新比例。在归一化结构中,函数输出有时对权重整体缩放并不敏感,可权重方向上的有效更新幅度仍会受范数影响:范数越大,同样大小的参数更新带来的方向变化通常越小。
当衰减系数适中时,参数范数更容易进入动态平衡区间。此时,梯度带来的扩张与衰减带来的收缩大致抵消,模型既能继续学习新模式,又不至于让权重尺度无限漂移。对于接近单遍数据训练的大模型,已有研究指出,权重衰减的重要作用可能更多体现为改善随机优化中的偏差与方差平衡、降低训练损失并增强混合精度训练稳定性,而不只是传统意义上的防止过拟合 [2]。
若衰减系数过大,参数范数会被压得过低,新获得的梯度信息也会快速消散。常见表现包括训练损失下降缓慢、模型容量利用不足,以及中后期仍明显欠拟合。对嵌入层、输出层或少数尺度敏感参数而言,统一施加强衰减还可能破坏其功能,因此实践中通常不会对所有参数组采用完全相同的处理。
三、从范数轨迹看预训练泛化
较小的参数范数有时与更简单的函数和更好的泛化相关,但不能把“范数越小越好”当成普遍规律。Transformer 中存在 LayerNorm、残差连接和多种尺度不变性,相同函数可能对应不同的参数范数;不同层的范数也缺乏直接可比性。真正值得关注的是范数轨迹是否稳定、各层是否显著分化,以及这种变化是否与验证损失同步。
衰减不足时,模型可能更快贴合训练数据中的偶然模式,训练损失继续改善而验证损失收益减弱。衰减过强时,训练集和验证集往往同时表现不佳。适中的衰减则可能让优化过程停留在更有利的尺度区间,使更新保持足够活跃,并减少参数对局部噪声的过度响应。因此,预训练泛化性能通常随衰减系数呈现区间最优,而不是简单的单调关系。
四、系数不能脱离训练配置单独讨论
权重衰减的累计强度同时取决于学习率曲线和训练步数。同一个系数配合更高峰值学习率、更长训练周期或不同的学习率衰减方案,最终产生的参数收缩量并不相同。直观地说,决定作用的是整个训练过程中“学习率×衰减系数”的累计效果,而不是配置文件中的某个孤立数字。
批量大小、数据量和模型规模同样会改变较优取值。针对大模型预训练的研究提出,可以从 AdamW 的优化时间尺度理解这些变量之间的关系;在模型和数据量固定时,改变批量大小往往需要同步调整衰减强度,而随着 Tokens-per-Parameter 比例变化,最优时间尺度也可能遵循不同规律 [3]。这说明直接照搬其他项目的系数,即使模型结构相似,也未必可靠。
五、可执行的监控与调参方法
- 记录分层范数:分别追踪注意力投影、MLP、嵌入层和归一化参数,不要只看全模型总范数。
- 联合观察损失:同时比较训练损失、验证损失和范数轨迹,识别欠拟合、尺度漂移及验证收益停滞。
- 采用对数间隔搜索:围绕基线设置偏小、基准和偏大三至五组系数,比在很窄范围内微调更容易发现趋势。
- 保持实验可比:搜索衰减系数时尽量固定学习率计划、批量大小、训练 Token 数、随机种子和数据顺序。
- 划分参数组:偏置项和归一化层参数通常可设为不衰减或单独调节,嵌入及输出层则应根据架构与权重绑定方式验证。
- 关注中后期平台:理想轨迹不要求范数完全不变,但应避免个别层持续无界增长或快速塌缩。
总结
权重衰减系数通过控制参数收缩速度,塑造大模型参数范数从增长到动态平衡的全过程。系数过小可能造成尺度漂移和有效方向更新变慢,过大则容易抑制表示学习并导致欠拟合;合适的取值能够稳定优化动力学,在训练拟合能力与验证表现之间取得更合理的平衡。实际调参时,应把衰减系数与学习率、批量大小、训练步数、模型宽度及参数分组共同考察,并以分层范数轨迹和验证损失作为核心依据,而不是机械追求更小的参数范数。