Skip to main content
QUICK REVIEW

[论文解读] An Investigation of how Label Smoothing Affects Generalization

Blair Chen, Liu Ziyin|arXiv (Cornell University)|Oct 23, 2020
Machine Learning and Data Classification参考文献 27被引用 8
一句话总结

本文提出了一套理论框架,解释了标签平滑如何通过在存在标签噪声时充当正则化器来减少泛化损失。该框架推导出最优标签平滑超参数 $ p^* $ 的闭式表达式,该参数可最小化测试损失,并在多个数据集和模型上通过实证验证了该预测。

ABSTRACT

It has been hypothesized that label smoothing can reduce overfitting and improve generalization, and current empirical evidence seems to corroborate these effects. However, there is a lack of mathematical understanding of when and why such empirical improvements occur. In this paper, as a step towards understanding why label smoothing is effective, we propose a theoretical framework to show how label smoothing provides in controlling the generalization loss. In particular, we show that this benefit can be precisely formulated and identified in the label noise setting, where the training is partially mislabeled. Our theory also predicts the existence of an optimal label smoothing point, a single value for the label smoothing hyperparameter that minimizes generalization loss. Extensive experiments are done to confirm the predictions of our theory. We believe that our findings will help both theoreticians and practitioners understand label smoothing, and better apply them to real-world datasets.

研究动机与目标

  • 为解决深度学习中标签平滑为何能改善泛化性能的理论理解不足问题。
  • 将标签平滑形式化为一种正则化技术,用于控制模型表达能力与泛化损失之间的权衡。
  • 在存在标签噪声的条件下,推导出最优标签平滑超参数 $ p^* $ 的精确数学预测。
  • 通过在真实世界数据集(如 MNIST 和 CIFAR10)上的大量实验,验证理论预测。
  • 识别在标签平滑下最小化测试损失与最大化测试准确率之间的脱节,揭示模型评估中的一个开放问题。

提出的方法

  • 将标签平滑过程建模为使用平滑矩阵 $ S_p $ 对独热目标进行变换,其中对角线元素为 $ p $,非对角线元素为 $ \frac{1-p}{M-1} $,表示均匀标签平滑。
  • 通过将真实类别分布建模为干净标签与受损标签的混合分布(干净率 $ a $),分析在标签噪声下的泛化损失。
  • 推导出在 $ \alpha $-型和 $ \beta $-型噪声模型下预期测试损失 $ \ell(a,p) $ 的理论表达式,表明其为 $ p $ 的凸函数。
  • 利用 $ \beta $-型噪声模型,推导出最小化预期泛化损失的最优平滑参数 $ p^* $ 的闭式解。
  • 通过测量多种模型、随机种子和数据集(如 MNIST、CIFAR10)的测试损失,验证理论预测,显示理论与实验之间具有高度一致性。
  • 应用詹森不等式,探索一种潜在的新方法——logit平滑,通过扩展标签平滑与前向矩阵公式。

实验结果

研究问题

  • RQ1在存在标签噪声的情况下,标签平滑如何减少泛化误差,且能否以数学方式形式化?
  • RQ2最小化泛化损失的标签平滑超参数 $ p $ 的最优值是什么,能否以闭式形式推导?
  • RQ3理论预测的最优 $ p^* $ 是否与在多样化数据集和架构上的实证测试损失一致?
  • RQ4为何最小化测试损失的最优 $ p $ 与最大化测试准确率的最优 $ p $ 之间存在差异,这对模型评估意味着什么?
  • RQ5该理论框架能否扩展至非均匀平滑或如 logit平滑等新变体?

主要发现

  • 理论框架预测,标签平滑作为一种正则化器,可控制泛化损失,尤其在存在标签噪声时,并为最优平滑参数 $ p^* $ 提供了闭式表达式。
  • 在 MNIST 和 CIFAR10 上的大量实验表明,不同干净率 $ a $ 下,预测与实测测试损失高度一致,验证了理论模型。
  • 最优平滑参数 $ p^* $ 与干净率 $ a $ 呈正相关,表明标签质量越高,所需平滑程度越低。
  • 尽管测试损失的预测与实测高度一致,但在最小化测试损失与最大化测试准确率的最优 $ p $ 之间存在显著差异,表明在标签平滑下损失与准确率并不总是一致。
  • 该框架提出了一条新的平滑方向——logit平滑,由詹森不等式推导而来,可能带来性能提升,值得进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。