在大模型预训练中,标签平滑看似只是对交叉熵目标的一处小改动,却会同时影响概率分布、置信度表达和特征学习。平滑强度过低,模型可能继续形成尖锐且过度自信的预测;强度过高,又可能削弱有效监督信号。因此,真正值得讨论的不是“是否使用”,而是“在什么阶段、以多大强度使用”。
标签平滑改变了什么
标准语言模型通常把正确词元视为概率为 1 的目标,其余词元概率为 0。标签平滑则将一部分目标概率分配给其他词元。若平滑系数记为 ε,那么 ε 越大,目标分布越平坦,模型受到的“必须把正确词元概率推到极限”的压力越小。
从优化角度看,标签平滑相当于给置信度增加约束。它不会直接告诉模型哪些替代词更合理,而是阻止输出分布无限趋近于独热标签。早期研究已表明,标签平滑能够抑制过度自信,但也会改变最后一层表示的聚类方式,进而影响知识蒸馏等后续用途,可参考来源链接。
平滑强度与预训练校准
较弱平滑:保留学习能力,但校准改善有限
当 ε 很小时,训练目标仍接近普通交叉熵。模型对高频、低歧义词元的学习通常不会受到明显干扰,同时极端 logit 会得到一定抑制。不过,如果模型规模大、训练轮次多或语料中存在大量近似重复内容,轻微平滑未必足以消除过度自信。
这里的“校准”不能简单理解为概率更低。理想状态是:模型给出约 80% 置信度的一组预测,长期来看也应有接近 80% 的正确率。标签平滑若只是统一压低概率,可能改善某些校准误差指标,却不一定提升模型识别自身错误的能力。
中等平滑:通常形成更实用的折中
适度增大 ε,可以减少模型对单一词元标签的机械拟合,尤其是在自然语言存在同义表达、分词边界差异和上下文多解性的情况下。输出分布不再过度尖锐,往往有利于缓解置信度虚高,并让隐藏表示减少围绕训练标签的极端分离。
但大模型词表通常包含数万乃至更多词元,把平滑质量均匀分配给整个词表并不等于提供了有语义的信息。ICML 2025 的一项研究指出,标签平滑可以帮助维持指令微调阶段的校准,但在大词表模型中效果可能减弱,其作用还与隐藏维度和词表规模有关,详见论文说明[2]。
过强平滑:校准不等于全面变好
ε 过大时,正确词元与错误词元之间的目标差距会被显著压缩。模型可能表现得“不那么自信”,但这不代表它更准确地知道自己何时会出错。强平滑还可能降低对罕见实体、专业术语、代码符号和严格格式的区分能力,因为这些任务往往需要形成非常明确的条件概率峰值。
低置信度不是校准本身。只有当置信度与实际正确率相匹配时,概率输出才具有可靠的决策意义。
对下游任务泛化的不同影响
标签平滑对下游泛化并非单向增益,其效果取决于任务是否需要容忍语义替代。分类、主题识别和部分自然语言推断任务可能受益于更平滑的表示,因为模型不容易记住预训练样本中的偶然对应关系。面对轻微分布偏移时,这种正则化也可能降低预测边界的脆弱性。
对于机器翻译、开放式生成和摘要任务,适度平滑可能增加候选词元的多样性,但强度过高会让模型难以突出关键实体和确定性事实。对于数学推理、代码生成及结构化输出,过强平滑尤其可能造成符号选择不够坚决,使局部错误沿自回归生成链条继续传播。
还应区分预训练与下游微调。预训练阶段的数据规模巨大,标签平滑会影响基础表示和整体概率结构;监督微调数据较少,模型则更容易快速过拟合并出现置信度漂移。已有研究观察到指令微调可能损害模型校准,而在监督微调中引入标签平滑是一种具有可操作性的缓解办法,可参见完整研究[3]。
如何选择和评估平滑强度
- 不要只看困惑度:同时记录负对数似然、准确率、期望校准误差、Brier 分数以及可靠性图,避免把概率整体下降误判为校准改善。
- 采用小范围递增实验:从不平滑基线开始设置若干递增强度,保持数据、学习率、训练步数和随机种子尽量一致。
- 按任务拆分评估:分别检查知识问答、推理、代码、长尾实体、分布外样本和结构化生成,平均分可能掩盖关键能力退化。
- 关注词表规模:统一分配到全词表的平滑质量可能过于分散,可研究基于词频、语义邻近词或教师分布的非均匀方案,但必须通过消融实验验证。
- 考虑分阶段策略:预训练早期可使用较弱正则,训练后期或监督微调阶段再依据校准结果调整,不必让一个固定 ε 贯穿所有阶段。
总结
标签平滑强度决定了模型在“充分学习确定性模式”与“避免过度自信”之间的位置。较弱平滑对原始能力影响较小,但校准收益可能有限;适度平滑通常更有利于抑制尖锐分布和提升部分下游任务的稳健性;过强平滑则可能造成欠置信、损害长尾知识与精确生成。实践中应把它视为需要联合模型规模、词表结构、训练阶段和任务类型调节的超参数,并通过准确性、校准性与分布外泛化三组指标共同决策,而不是寻找一个适用于所有大模型的固定数值。