Skip to main content
QUICK REVIEW

[论文解读] Regularizing Neural Networks via Adversarial Model Perturbation

Yaowei Zheng, Richong Zhang|arXiv (Cornell University)|Oct 10, 2020
Advanced Neural Network Applications参考文献 54被引用 7
一句话总结

本文提出对抗性模型扰动(AMP),一种新颖的正则化技术,通过最小化在模型参数范数有界扰动内的最坏情况经验风险所导出的'AMP损失',来提升深度神经网络的泛化性能。该方法在理论上倾向于平坦极小值——与更好泛化性能相关联——并在多个图像分类基准上实现了最先进性能,优于现有的正则化方法,包括MixUp和Flooding。

ABSTRACT

Effective regularization techniques are highly desired in deep learning for alleviating overfitting and improving generalization. This work proposes a new regularization scheme, based on the understanding that the flat local minima of the empirical risk cause the model to generalize better. This scheme is referred to as adversarial model perturbation (AMP), where instead of directly minimizing the empirical risk, an alternative "AMP loss" is minimized via SGD. Specifically, the AMP loss is obtained from the empirical risk by applying the "worst" norm-bounded perturbation on each point in the parameter space. Comparing with most existing regularization schemes, AMP has strong theoretical justifications, in that minimizing the AMP loss can be shown theoretically to favour flat local minima of the empirical risk. Extensive experiments on various modern deep architectures establish AMP as a new state of the art among regularization schemes. Our code is available at https://github.com/hiyouga/AMP-Regularizer.

研究动机与目标

  • 开发一种有原则的正则化方案,通过针对经验风险的平坦局部极小值来改善深度神经网络的泛化性能。
  • 解决现有启发式正则化方法(如MixUp和标签平滑)缺乏强有力的理论依据的问题。
  • 探究在参数空间中对模型参数进行对抗性扰动是否能隐式惩罚尖锐极小值并促进更平坦、更具泛化能力的解。
  • 在标准图像分类基准上评估AMP相对于最先进正则化技术的性能表现。
  • 分析扰动幅度对模型泛化和校准的影响,并评估计算开销。

提出的方法

  • 将AMP损失定义为在ℓ2球半径ε内的所有参数扰动中经验风险的最大值:ℒ_AMP(θ) = max_{||Δ||≤ε} ℒ_ERM(θ + Δ)。
  • 使用小批量随机梯度下降最小化AMP损失,从而有效训练模型以抵御参数空间中的小规模对抗性扰动。
  • 证明最小化AMP损失等价于带有额外梯度范数惩罚的正则化经验风险最小化,从而提供一种替代的理论解释。
  • 通过单次内部优化步骤(N=1)实现AMP训练过程,以在计算成本与有效性之间取得平衡。
  • 借鉴参数空间中的最大池化类比:AMP损失在经验风险景观上起到'最坏情况'平滑作用,偏好更平坦的区域。
  • 使用局部极小值的最窄宽度作为平坦度的度量,并证明AMP最小化隐式惩罚了狭窄极小值。

实验结果

研究问题

  • RQ1在参数空间中对模型参数进行对抗性扰动是否能导致更平坦的极小值并改善泛化性能?
  • RQ2与MixUp和Flooding等依赖数据的正则化技术相比,AMP正则化方案在测试准确率和校准性能方面表现如何?
  • RQ3实现最佳泛化性能的最优扰动幅度ε是多少?
  • RQ4AMP是否能改善模型校准性能,如通过期望校准误差(ECE)所衡量?
  • RQ5与标准ERM训练相比,AMP的计算成本如何?是否可以在不牺牲性能的前提下使其更高效?

主要发现

  • AMP在SVHN、CIFAR-10和CIFAR-100上实现了最先进测试准确率,优于ERM、MixUp、Flooding和标签平滑。
  • 在CIFAR-10上,AMP将期望校准误差(ECE)降低至2.1%,表明其在模型校准方面优于其他方法。
  • 最优扰动半径ε ≈ 0.06时测试误差最低,表明所选极小值的平坦度与深度之间存在权衡。
  • 使用N=1内部迭代的AMP训练使训练时间仅增加1.8倍,表明其计算上是可行的。
  • AMP损失景观显示,右侧(平坦)极小值低于左侧(尖锐)极小值,证实AMP倾向于更平坦的极小值。
  • AMP通过选择具有更广阔基底的极小值来改善泛化性能,这一点由局部极小值的最窄宽度被隐式最小化所证实。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。