Skip to main content
QUICK REVIEW

[论文解读] On the Distributional Properties of Adaptive Gradients

Zhiyi Zhang, Liu Ziyin|arXiv (Cornell University)|May 15, 2021
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 4
一句话总结

本文对自适应梯度方法(特别是Adam)的分布特性进行了理论分析,表明即使在各向同性高斯梯度下,参数更新的方差在时间上始终保持有限且有界,这与先前认为方差发散必须依赖学习率预热的观点相矛盾。该研究推导了每个时间步的精确更新分布,并在Transformer等现代架构上进行了实验验证。

ABSTRACT

Adaptive gradient methods have achieved remarkable success in training deep neural networks on a wide variety of tasks. However, not much is known about the mathematical and statistical properties of this family of methods. This work aims at providing a series of theoretical analyses of its statistical properties justified by experiments. In particular, we show that when the underlying gradient obeys a normal distribution, the variance of the magnitude of the extit{update} is an increasing and bounded function of time and does not diverge. This work suggests that the divergence of variance is not the cause of the need for warm up of the Adam optimizer, contrary to what is believed in the current literature.

研究动机与目标

  • 研究自适应梯度方法的统计特性,特别是训练过程中参数更新的方差和分布。
  • 挑战当前普遍认为自适应方法中方差发散必须依赖学习率预热的观点,尤其是在Transformer等模型中。
  • 在各向同性高斯梯度假设下,推导Adam中更新的精确解析分布,为观察到的训练动态提供理论基础。
  • 在单轨迹层面,将理论预测与现代深度学习模型(包括Transformer和CNN)的实际数据进行对比验证。
  • 探索理论预测与实际结果出现偏差的条件,例如梯度均值非零或重尾分布。

提出的方法

  • 在独立同分布的各向同性高斯梯度和时间平均预条件矩阵的假设下,推导Adam中参数更新Δθ的精确分布。
  • 证明即使在不假设梯度分布的前提下,更新幅度的方差也始终有界且随时间单调递增。
  • 通过解析推导与仿真表明,更新分布从双峰过渡为单峰,并随训练进程收敛至正态分布。
  • 通过单次运行数据,对MNIST、ResNet-18、VGG-21和Transformer的实际训练轨迹进行实证验证,对比预测分布。
  • 引入受控梯度分布(如时变方差、非零均值、柯西分布)以研究理论偏差,理解现实世界中的差异。
  • 分析梯度相关性和重尾分布对更新分布形状的影响,包括实际中观察到的三峰结构。

实验结果

研究问题

  • RQ1自适应梯度更新的方差在训练过程中是否发散?若否,其随时间的变化行为如何?
  • RQ2在各向同性高斯梯度假设下,Adam中更新分布的精确解析形式是什么?
  • RQ3为何实际训练轨迹表现出双峰或三峰的更新分布?其与梯度分布特性的关系是什么?
  • RQ4基于独立同分布梯度的理论预测在实践中(尤其是在Transformer等深度模型中)的适用程度如何?
  • RQ5非零均值或重尾梯度分布如何导致更新分布偏斜或畸变?

主要发现

  • 自适应梯度更新的方差始终有限且有界,与Liu等人(2019)声称的方差发散需预热的观点相矛盾。
  • 在各向同性高斯梯度下,更新分布对所有有限时间步均有界,且从双峰过渡为单峰,随t → ∞收敛至正态分布。
  • 更新幅度的方差随时间单调递增,表明早期训练步骤更具变异性,但整体更新仍保持稳定。
  • 理论预测在包括Transformer在内的多种架构中与实际分布高度吻合,即使在单轨迹层面亦然。
  • 非零均值梯度导致左偏的更新分布,且随着均值幅度增大,偏度减小、分布变薄。
  • 重尾梯度分布(如柯西分布)会导致三峰更新分布,表明训练中存在罕见的高范数梯度或强噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。