Skip to main content
QUICK REVIEW

[论文解读] LaProp: Separating Momentum and Adaptivity in Adam

Liu Ziyin, Zhikang T. Wang|arXiv (Cornell University)|Feb 12, 2020
Stochastic Gradient Optimization Techniques参考文献 39被引用 14
一句话总结

该论文提出 LaProp,一种新型自适应优化器,通过解耦 Adam 类优化器中的动量与自适应性,解决了二者耦合导致的不稳定性问题。通过分离这两个组件,LaProp 实现了更优的训练稳定性和灵活性,在多种任务中持续优于 Adam,包括存在噪声、不稳定及困难的优化问题,同时保持相同的超参数数量,并支持在带符号梯度方法与自适应方法之间实现平滑插值。

ABSTRACT

We identity a by-far-unrecognized problem of Adam-style optimizers which results from unnecessary coupling between momentum and adaptivity. The coupling leads to instability and divergence when the momentum and adaptivity parameters are mismatched. In this work, we propose a method, Laprop, which decouples momentum and adaptivity in the Adam-style methods. We show that the decoupling leads to greater flexibility in the hyperparameters and allows for a straightforward interpolation between the signed gradient methods and the adaptive gradient methods. We experimentally show that Laprop has consistently improved speed and stability over Adam on a variety of tasks. We also bound the regret of Laprop on a convex problem and show that our bound differs from that of Adam by a key factor, which demonstrates its advantage.

研究动机与目标

  • 解决由于动量与自适应性参数耦合而导致的 Adam 类优化器中的不稳定与发散问题。
  • 开发一种新优化算法,在保持 Adam 优势的同时,提升超参数选择的鲁棒性与灵活性。
  • 实现带符号梯度方法与自适应梯度方法之间的平滑插值,这是 Adam 所无法实现的。
  • 理论上界定了 LaProp 在凸问题上的遗憾,展示了其相对于 Adam 和 AMSGrad 的关键优势。
  • 在多个基准测试中,包括 Atari、CIFAR-10 和 MNIST,持续证明 LaProp 相较于 Adam 的性能提升,尤其在存在噪声或不稳定的训练环境中。

提出的方法

  • 通过引入独立于自适应缩放的动量项更新规则,实现动量与自适应梯度缩放的解耦。
  • 采用修改后的更新规则,其中有效学习率由独立的自适应组件决定,而动量则独立更新。
  • 为自适应组件引入基于缓冲区的 RMS 归一化,类似于 RMSProp,但与动量动态解耦。
  • 以与 Adam 一致的方式应用学习率调度和权重衰减,但关键区别在于自适应缩放不影响动量更新。
  • 在自适应组件中采用随机替换策略维护计算效率。
  • 保持与 Adam 相同的超参数数量(学习率、beta1 用于动量、beta2 用于自适应缩放),从而实现超参数设置的直接迁移。

实验结果

研究问题

  • RQ1当动量与自适应性参数不匹配时,Adam 类优化器中不稳定性与发散的根本原因是什么?
  • RQ2是否可以在 Adam 类优化器中实现动量与自适应性的解耦,以提升训练稳定性和灵活性?
  • RQ3解耦动量与自适应性是否能实现带符号梯度方法与自适应梯度方法之间的平滑插值?
  • RQ4LaProp 的遗憾界与 Adam 和 AMSGrad 相比如何?这对收敛性能意味着什么?
  • RQ5LaProp 是否能在多种深度学习任务中持续优于 Adam,尤其是在存在噪声或不稳定的训练环境中?

主要发现

  • LaProp 在多种任务中持续优于 Adam,包括 Atari2600 游戏和 CIFAR-10 图像分类,训练稳定性显著提升。
  • 在 Atari2600 上,LaProp 在 20 个游戏中均实现了高于 Adam 的平均奖励,学习曲线更平滑,且未观察到发散现象。
  • 在 CIFAR-10 上,当 $\nu < 0.4$ 或 $\nu$ 显著小于 $\nu$ 时,Adam 经常发散,而 LaProp 在相同条件下仍保持稳定。
  • LaProp 在测试损失方面泛化能力优于 Adam,尤其当 Adam 接近发散时,其测试损失更低,尽管训练损失相似或更高。
  • 当 Adam 未发散时,其通常能达到比 LaProp 更低的训练损失,但 LaProp 维持了更低且更稳定的测试损失,表明泛化性能更优。
  • LaProp 的遗憾界为 $O(\sqrt{T})$,与 Adam 和 AMSGrad 相比存在关键差异,增强了灵活性,可能带来更好的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。