Skip to main content
QUICK REVIEW

[论文解读] Implicit Gradient Regularization

David G. T. Barrett, Benoît Dherin|arXiv (Cornell University)|Sep 23, 2020
Stochastic Gradient Optimization Techniques参考文献 63被引用 5
一句话总结

本文提出了隐式梯度正则化(IGR),一种由离散更新步长引起的梯度下降中的隐式正则化形式,通过偏好损失曲面的平坦区域来惩罚尖锐极小值。利用逆误差分析,作者推导出IGR对应于与梯度范数平方成正比的正则化项,并通过实证表明其与更低的测试误差和更强的鲁棒性相关,尤其在较大学习率下表现显著。

ABSTRACT

Gradient descent can be surprisingly good at optimizing deep neural networks without overfitting and without explicit regularization. We find that the discrete steps of gradient descent implicitly regularize models by penalizing gradient descent trajectories that have large loss gradients. We call this Implicit Gradient Regularization (IGR) and we use backward error analysis to calculate the size of this regularization. We confirm empirically that implicit gradient regularization biases gradient descent toward flat minima, where test errors are small and solutions are robust to noisy parameter perturbations. Furthermore, we demonstrate that the implicit gradient regularization term can be used as an explicit regularizer, allowing us to control this gradient regularization directly. More broadly, our work indicates that backward error analysis is a useful theoretical approach to the perennial question of how learning rate, model size, and parameter regularization interact to determine the properties of overparameterized models optimized with gradient descent.

研究动机与目标

  • 识别并形式化由于离散数值积分导致的梯度下降中此前未被认识到的隐式正则化形式。
  • 解释为何在深度网络中,尽管存在发散风险,较大的学习率通常能带来更好的泛化能力和鲁棒性。
  • 证明该隐式正则化效应可通过推导出的正则化项显式控制和测量。
  • 将数值积分理论中的逆误差分析与深度学习模型的泛化特性相连接。
  • 验证IGR与更平坦的极小值、更低的测试误差以及更强的鲁棒性相关,且在多种架构和数据集上均成立。

提出的方法

  • 对离散梯度下降更新规则应用逆误差分析,推导出离散轨迹所逼近的修正损失函数。
  • 将隐式梯度正则化项(IGR)作为修正损失中的二阶校正项,其与损失梯度范数的平方成正比:$ R_{IG}\left(\theta\right) = \frac{1}{m}\sum_{i=1}^{m}\left(\nabla_{\theta_i}E\left(\theta\right)\right)^2 $。
  • 利用微分几何证明IGR会惩罚损失曲面曲率较高的区域,从而偏好更平坦的极小值。
  • 在MLP(MNIST)和ResNets(CIFAR-10)上对IGR进行实证评估,涵盖不同学习率、网络规模和批量大小。
  • 在达到最大测试准确率的时刻比较模型,以避免因任意停止时间带来的偏差,测量 $ R_{IG} $、$ E(\theta) $ 和测试误差。
  • 证明可通过将 $ R_{IG} $ 添加到损失中,将其用作显式正则化项,从而实现对正则化强度的直接控制。

实验结果

研究问题

  • RQ1梯度下降在深度神经网络中的离散步长会诱导出何种形式的隐式正则化?
  • RQ2该隐式正则化强度与学习率及模型泛化能力之间的关系如何?
  • RQ3能否通过推导出的正则化项显式测量并控制隐式正则化效应?
  • RQ4隐式梯度正则化是否与更平坦的极小值、更低的测试误差以及更强的鲁棒性相关?
  • RQ5逆误差分析在多大程度上为理解学习率、模型规模与泛化能力之间的相互作用提供了理论框架?

主要发现

  • IGR通过逆误差分析被推导为损失函数的二阶校正项,其正则化强度为 $ \lambda = \frac{hm}{4} $,其中 $ h $ 为学习率,$ m $ 为参数数量。
  • 使用较大学习率训练的模型表现出显著更低的 $ R_{IG}(\theta)/E(\theta) $ 值,与IGR偏好更平坦极小值的结论一致。
  • 测试准确率与 $ R_{IG} $ 的大小强相关,$ R_{IG} $ 值越低,MNIST和CIFAR-10上的泛化能力越强。
  • 该隐式正则化效应在不同批量大小下均表现稳健,包括全批量和随机梯度下降。
  • 在CIFAR-10上训练ResNet-18模型的结果表明,增大学习率可降低 $ R_{IG} $ 并提升测试准确率,证实了在更大模型中的趋势。
  • 通过将 $ R_{IG} $ 显式添加到损失中,可直接控制正则化强度,其效果超越标准训练所能达到的隐式最大正则化程度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。