Skip to main content
QUICK REVIEW

[论文解读] On the adequacy of untuned warmup for adaptive optimization

Jerry Ma, Denis Yarats|arXiv (Cornell University)|Oct 9, 2019
Advanced Bandit Algorithms Research参考文献 31被引用 22
一句话总结

本文表明,对 Adam 优化器采用简单的线性学习率热身——具体为在 $2/(1-\beta_2)$ 个训练迭代内进行——其性能与更复杂的 RAdam 算法相当,后者声称可自动校正自适应学习率的方差。作者证明 RAdam 等价于四次初始动量步骤后接固定热身的 Adam,且训练初期参数更新幅度的不稳定性,而非梯度方差,才是热身的真正原因。

ABSTRACT

Adaptive optimization algorithms such as Adam are widely used in deep learning. The stability of such algorithms is often improved with a warmup schedule for the learning rate. Motivated by the difficulty of choosing and tuning warmup schedules, recent work proposes automatic variance rectification of Adam's adaptive learning rate, claiming that this rectified approach ("RAdam") surpasses the vanilla Adam algorithm and reduces the need for expensive tuning of Adam with warmup. In this work, we refute this analysis and provide an alternative explanation for the necessity of warmup based on the magnitude of the update term, which is of greater relevance to training stability. We then provide some "rule-of-thumb" warmup schedules, and we demonstrate that simple untuned warmup of Adam performs more-or-less identically to RAdam in typical practical settings. We conclude by suggesting that practitioners stick to linear warmup with Adam, with a sensible default being linear warmup over $2 / (1 - β_2)$ training iterations.

研究动机与目标

  • 挑战 RAdam 作者声称的‘RAdam 消除了对学习率热身的需求’这一论断,重新评估自适应优化中热身的潜在原因。
  • 探究 Adam 早期训练中的不稳定性是否更应归因于更新幅度动态而非梯度方差。
  • 为 Adam 提出简单且未调优的热身调度方案,使其在多种模型和超参数设置下性能与 RAdam 相当。
  • 提供一种实用的默认热身调度方案,避免昂贵的超参数调优,同时保持训练稳定性和收敛性。

提出的方法

  • 将 RAdam 重新表达为四次初始的重球动量步骤后接固定热身的 Adam,表明其并非根本上全新的优化算法。
  • 通过模拟分析 Adam 在早期训练中参数更新的幅度,即使在模拟的局部最小值处也进行分析。
  • 基于超参数 $\beta_2$ 提出经验法则热身调度,具体为在 $2/(1 - \beta_2)$ 次迭代内进行线性热身。
  • 在多个模型和超参数设置下,对比未调优线性热身与 RAdam 的训练动态和性能。
  • 通过基于模拟的分析表明,Adam 中的更新幅度会迅速收敛到平稳分布,暗示早期不稳定性并非源于梯度方差。
  • 在标准和极端超参数设置下(包括不同的 $\beta_2$ 值和学习率)评估所提热身调度的有效性。

实验结果

研究问题

  • RQ1Adam 中学习率热身的需求是否真如 RAdam 作者所声称的那样,由梯度方差驱动?
  • RQ2能否为 Adam 设计一种简单且未调优的热身调度,使其在多种深度学习设置下性能与 RAdam 相当?
  • RQ3Adam 早期训练中不稳定的真正原因是什么——是梯度方差还是更新幅度动态?
  • RQ4Adam 中参数更新的幅度在早期训练中如何演变?是否迅速稳定?
  • RQ5能否推导出一种默认热身调度,使其在避免超参数调优的同时保持训练稳定性?

主要发现

  • RAdam 在数学上等价于四次初始动量步骤后接固定热身的 Adam,而非一种根本上全新的优化方法。
  • 基于方差的热身解释存在缺陷,因为它忽略了 Adam 中一阶矩和二阶矩估计器之间的相关性。
  • 即使在模拟的局部最小值处,Adam 在早期阶段的更新幅度仍表现出显著的非规律性,表明不稳定的根源远超梯度方差。
  • 在 $2/(1 - \beta_2)$ 次迭代内进行线性热身,可在广泛范围的模型和超参数下实现与 RAdam 无法区分的性能和训练动态。
  • 在 RAdam 和所提出的经验法则调度中,有效热身周期约为 1000 次迭代(当 $\beta_2 = 0.999$ 时),尽管更新幅度理论上在约 40 次迭代内即已收敛。
  • Adam 在训练后期的更新幅度对梯度方差或平稳性基本不敏感,表明学习率衰减是改善后期收敛性的主要调控手段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。