Skip to main content
QUICK REVIEW

[论文解读] Label Noise SGD Provably Prefers Flat Global Minimizers

Alex Damian, Tengyu Ma|arXiv (Cornell University)|Jun 11, 2021
Machine Learning and Data Classification参考文献 25被引用 7
一句话总结

该论文证明了在过参数化模型中,带有标签噪声的随机梯度下降(SGD)通过收敛到正则化损失 $L(\theta) + \lambda R(\theta)$ 的驻点,实现了隐式正则化,其中 $R(\theta)$ 惩罚尖锐极小值。正则化强度 $\lambda$ 取决于学习率、批量大小和噪声方差,表明标签噪声倾向于选择平坦的全局极小值,从而提升模型泛化性能。

ABSTRACT

In overparametrized models, the noise in stochastic gradient descent (SGD) implicitly regularizes the optimization trajectory and determines which local minimum SGD converges to. Motivated by empirical studies that demonstrate that training with noisy labels improves generalization, we study the implicit regularization effect of SGD with label noise. We show that SGD with label noise converges to a stationary point of a regularized loss $L(θ) +λR(θ)$, where $L(θ)$ is the training loss, $λ$ is an effective regularization parameter depending on the step size, strength of the label noise, and the batch size, and $R(θ)$ is an explicit regularizer that penalizes sharp minimizers. Our analysis uncovers an additional regularization effect of large learning rates beyond the linear scaling rule that penalizes large eigenvalues of the Hessian more than small ones. We also prove extensions to classification with general loss functions, SGD with momentum, and SGD with general noise covariance, significantly strengthening the prior work of Blanc et al. to global convergence and large learning rates and of HaoChen et al. to general models.

研究动机与目标

  • 理解标签噪声在过参数化模型中对SGD隐式正则化的影响。
  • 识别标签噪声如何引导优化过程趋向平坦的全局极小值,从而改善泛化性能。
  • 将先前的局部稳定性分析扩展至全局收敛性及更广泛的情境,包括一般损失函数和动量方法。
  • 形式化学习率和批量大小在控制损失与正则化之间平衡中的作用。

提出的方法

  • 将带有标签噪声的SGD形式化为对正则化损失 $L(\theta) + \lambda R(\theta)$ 的扰动梯度下降,其中 $R(\theta)$ 惩罚尖锐极小值。
  • 基于损失的Hessian矩阵与噪声协方差,推导出正则项 $R(\theta)$ 的显式表达式。
  • 通过SGD动力学的线性化分析,证明其收敛于正则化目标的驻点。
  • 建立更大的学习率和更小的批量大小会通过增强对大Hessian特征值的惩罚,从而增强正则化效果。
  • 将结果推广至分类任务中的一般损失函数、带动量的SGD以及一般噪声协方差矩阵。
  • 采用矩阵摄动理论与递推关系,控制误差项的增长并确保收敛性。

实验结果

研究问题

  • RQ1在过参数化模型中,SGD中的标签噪声是否会导致对平坦极小值的全局收敛?
  • RQ2学习率与批量大小如何影响由标签噪声引发的隐式正则化?
  • RQ3能否将标签噪声SGD的隐式偏差表征为收敛于正则化损失 $L(\theta) + \lambda R(\theta)$ 的驻点?
  • RQ4惩罚尖锐极小值的正则项 $R(\theta)$ 的显式形式是什么?
  • RQ5动量和一般噪声协方差如何影响标签噪声SGD的隐式正则化?

主要发现

  • 带有标签噪声的SGD收敛于 $L(\theta) + \lambda R(\theta)$ 的驻点,其中 $R(\theta)$ 惩罚尖锐极小值。
  • 有效正则化参数 $\lambda$ 与学习率 $\eta$、噪声方差 $\sigma^2$ 和批量大小的倒数 $1/B$ 的乘积成正比,即 $\lambda \propto \eta \sigma^2 / B$。
  • 更大的学习率和更小的批量大小会增强正则化效果,从而更倾向于选择平坦的极小值。
  • 该方法可严格证明地逃离不良局部极小值,并在从零误差全局极小值初始化时仍能实现全局收敛。
  • 该分析可扩展至分类任务中的一般损失函数、带动量的SGD以及任意噪声协方差矩阵。
  • 正则项 $R(\theta)$ 显式关联于损失的Hessian矩阵,对具有大特征值区域施加更高惩罚。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。