Skip to main content
QUICK REVIEW

[论文解读] Understanding the Generalization of Adam in Learning Neural Networks with Proper Regularization

Difan Zou, Yuan Cao|arXiv (Cornell University)|Aug 25, 2021
Neural Networks and Applications参考文献 35被引用 6
一句话总结

本文解释了为何在深度学习中,即使有适当的正则化,Adam 通常也比梯度下降(GD)泛化性能更差。研究表明,在具有图像类数据的过参数化两层卷积神经网络中,Adam 和 GD 收敛到不同的全局解:GD 学习有意义的特征并实现接近零的测试误差,而 Adam 则拟合噪声,其性能不优于随机猜测,这是由于非凸优化景观所致。

ABSTRACT

Adaptive gradient methods such as Adam have gained increasing popularity in deep learning optimization. However, it has been observed that compared with (stochastic) gradient descent, Adam can converge to a different solution with a significantly worse test error in many deep learning applications such as image classification, even with a fine-tuned regularization. In this paper, we provide a theoretical explanation for this phenomenon: we show that in the nonconvex setting of learning over-parameterized two-layer convolutional neural networks starting from the same random initialization, for a class of data distributions (inspired from image data), Adam and gradient descent (GD) can converge to different global solutions of the training objective with provably different generalization errors, even with weight decay regularization. In contrast, we show that if the training objective is convex, and the weight decay regularization is employed, any optimization algorithms including Adam and GD will converge to the same solution if the training is successful. This suggests that the inferior generalization performance of Adam is fundamentally tied to the nonconvex landscape of deep learning optimization.

研究动机与目标

  • 解释尽管有适当的正则化,Adam 与 GD 在深度神经网络中持续存在的泛化差距的原因。
  • 研究正则化本身是否足以解决 Adam 与 GD 之间的性能差异。
  • 分析在具有图像类数据的非凸、过参数化两层卷积神经网络设置下,Adam 与 GD 的收敛与泛化行为。
  • 对比 Adam 与 GD 在凸与非凸优化景观下的行为差异。

提出的方法

  • 作者研究了一个在由特征块与噪声块组成的数据上训练的两层卷积神经网络,以模拟图像类分布。
  • 他们使用权重衰减正则化,并分析在 Adam 与 GD 优化下训练动态的表现。
  • 理论分析证明,在适当的正则化下,Adam 与 GD 均能在多项式时间内收敛到零训练误差。
  • 该研究对比了学习到的权重向量,表明 GD 专注于真实特征块,而 Adam 则过度拟合到噪声块。
  • 作者证明,在具有正则化的凸设置中,Adam 与 GD 收敛到相同的唯一解,这与非凸设置下的情况不同。
  • 他们使用概率与高概率界来建立两种优化器之间泛化误差的差异。

实验结果

研究问题

  • RQ1为何即使在使用权重衰减正则化的情况下,Adam 在深度学习中的泛化性能仍显著劣于 GD?
  • RQ2Adam 与 GD 之间的泛化差距是否可由过参数化神经网络损失景观的非凸性来解释?
  • RQ3当训练目标为凸且带有正则化时,Adam 与 GD 是否收敛到相同的解?
  • RQ4是什么原因导致 Adam 拟合噪声块,而 GD 则学习数据中的有意义特征?
  • RQ5Adam 的泛化性能差是否根本上与非凸优化相关,还是可通过正则化加以修复?

主要发现

  • 在过参数化两层卷积神经网络的非凸设置下,即使初始化和权重衰减正则化相同,Adam 与 GD 仍收敛到不同的全局解。
  • GD 通过学习真实特征块实现近乎零的测试误差,而 Adam 的解由于过度拟合噪声块,其泛化性能不优于随机猜测。
  • 泛化差距的产生是因为 Adam 对数据中的噪声更敏感,导致其解主要由噪声分量主导。
  • 在具有权重衰减的凸设置中,Adam 与 GD 收敛到相同的唯一解,表明该差异的根本原因在于非凸性。
  • 理论分析确认,Adam 与 GD 均能在多项式时间内实现零训练误差,但其泛化性能因不同的优化轨迹而产生分歧。
  • 结果表明,正则化本身无法解决非凸深度学习设置下 Adam 与 GD 之间的泛化差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。