Skip to main content
QUICK REVIEW

[论文解读] EAdam Optimizer: How $\epsilon$ Impact Adam

Wei Yuan, Kaixin Gao|arXiv (Cornell University)|Nov 4, 2020
Advanced Neural Network Applications参考文献 34被引用 5
一句话总结

本文提出EAdam,一种简单而有效的Adam变体,通过将epsilon($\epsilon$)项从自适应学习率的分母移至方差更新中,避免了数值不稳定性,且无需额外超参数。实验表明,EAdam在图像分类、自然语言处理和目标检测任务中均优于Adam,并与RAdam和Adabelief相当或更优。

ABSTRACT

Many adaptive optimization methods have been proposed and used in deep learning, in which Adam is regarded as the default algorithm and widely used in many deep learning frameworks. Recently, many variants of Adam, such as Adabound, RAdam and Adabelief, have been proposed and show better performance than Adam. However, these variants mainly focus on changing the stepsize by making differences on the gradient or the square of it. Motivated by the fact that suitable damping is important for the success of powerful second-order optimizers, we discuss the impact of the constant $\\epsilon$ for Adam in this paper. Surprisingly, we can obtain better performance than Adam simply changing the position of $\\epsilon$. Based on this finding, we propose a new variant of Adam called EAdam, which doesn't need extra hyper-parameters or computational costs. We also discuss the relationships and differences between our method and Adam. Finally, we conduct extensive experiments on various popular tasks and models. Experimental results show that our method can bring significant improvement compared with Adam. Our code is available at https://github.com/yuanwei2019/EAdam-optimizer.

研究动机与目标

  • 研究超参数$\epsilon$在Adam优化器中的影响,该参数通常被视为固定的数值稳定器。
  • 解决Adam中已知的泛化与收敛性问题,尤其是在与SGD等非自适应方法对比时。
  • 探究将$\epsilon$在优化更新中重新定位是否能获得优于标准Adam的性能。
  • 开发一种对Adam的改进变体,以最小的修改实现训练稳定性和泛化能力的提升,且不增加计算成本。
  • 在包括图像分类、自然语言处理和目标检测在内的多样化深度学习任务中验证所提方法的有效性。

提出的方法

  • EAdam通过在偏差校正前将$\epsilon$加至运行方差$v_t$,而非加至学习率的分母,对Adam算法进行修改。
  • 方差更新规则变为$v_t \leftarrow \beta_2 v_{t-1} + (1 - \beta_2)(g_t^2 + \epsilon)$,其中$\epsilon$在优化过程中累积。
  • 此改动确保分母$\sqrt{\hat{v}_t} + \epsilon$保持数值稳定,同时保留梯度的自适应缩放。
  • 该方法保持与Adam相同的计算复杂度,无需额外超参数或操作。
  • 作者在多个模型和数据集上将EAdam与Adam、RAdam和Adabelief进行比较,以评估泛化与收敛性能。
  • 该算法已在GitHub上实现并发布,以确保可复现性并供社区使用。

实验结果

研究问题

  • RQ1在Adam优化器中,$\epsilon$的位置如何影响其训练动态与泛化性能?
  • RQ2是否可通过将$\epsilon$从分母移至方差更新中,在不增加计算成本的前提下提升泛化性能?
  • RQ3EAdam是否在包括图像分类、自然语言处理和目标检测在内的多样化深度学习任务中均优于Adam及其他Adam变体(如RAdam和Adabelief)?
  • RQ4通过直接在标准Adam中调优$\epsilon$,能否复现$\epsilon$重新定位带来的性能提升?
  • RQ5EAdam的性能提升在不同架构和数据集(包括ImageNet、Penn Treebank和PASCAL VOC)上是否具有鲁棒性?

主要发现

  • 在CIFAR-100上,EAdam相比Adam实现了显著更高的测试准确率,准确率提升达4%,尤其在深层模型中表现更优。
  • 在CIFAR-10数据集上,EAdam性能与以强大泛化能力著称的Adabelief相当。
  • 在Penn Treebank上的语言建模任务中,使用2层和3层LSTM,EAdam在2层模型上达到最低困惑度,在3层模型上也接近Adabelief。
  • 在PASCAL VOC上使用FPN的Faster R-CNN进行目标检测时,EAdam达到80.62的平均精度(mAP),优于Adam(71.47)和RAdam(76.58),并接近Adabelief(81.02)。
  • EAdam的性能提升无法通过直接调优标准Adam中的$\epsilon$实现,表明$\epsilon$的位置至关重要,而不仅仅是其数值大小。
  • EAdam在图像分类、自然语言处理和目标检测任务中均表现出快速收敛与强泛化能力,证实了$\epsilon$在自适应优化中位置的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。