Skip to main content
QUICK REVIEW

[論文レビュー] EAdam Optimizer: How $\epsilon$ Impact Adam

Wei Yuan, Kaixin Gao|arXiv (Cornell University)|Nov 4, 2020
Advanced Neural Network Applications参考文献 34被引用数 5
ひとこと要約

本稿では、適応的学習率の分母から分散更新へのepsilon ($ε$) の再配置により、追加のハイパーパrameterを必要とせず数値的不安定性を回避する、シンプルでありながら効果的なAdamの変種、EAdamを提案する。実験の結果、EAdamは画像分類、自然言語処理、オブジェクト検出のタスクにおいて、Adamを上回り、RAdam や Adabelief と同等またはそれ以上の性能を発揮することが示された。

ABSTRACT

Many adaptive optimization methods have been proposed and used in deep learning, in which Adam is regarded as the default algorithm and widely used in many deep learning frameworks. Recently, many variants of Adam, such as Adabound, RAdam and Adabelief, have been proposed and show better performance than Adam. However, these variants mainly focus on changing the stepsize by making differences on the gradient or the square of it. Motivated by the fact that suitable damping is important for the success of powerful second-order optimizers, we discuss the impact of the constant $\\epsilon$ for Adam in this paper. Surprisingly, we can obtain better performance than Adam simply changing the position of $\\epsilon$. Based on this finding, we propose a new variant of Adam called EAdam, which doesn't need extra hyper-parameters or computational costs. We also discuss the relationships and differences between our method and Adam. Finally, we conduct extensive experiments on various popular tasks and models. Experimental results show that our method can bring significant improvement compared with Adam. Our code is available at https://github.com/yuanwei2019/EAdam-optimizer.

研究の動機と目的

  • Adam最適化法におけるハイパーパramータ $\epsilon$ の影響を調査すること。通常、これは固定された数値的安定化要因として扱われる。
  • SGD や非適応的メソッドと比較して、Adamにおける一般化性能や収束性の問題を解決すること。
  • 最適化更新における $\epsilon$ の再配置が、標準的なAdamよりも優れた性能をもたらすかどうかを検討すること。
  • 最小限の変更で、追加の計算コストなしに訓練の安定性と一般化性能を向上させるAdamの変種を開発すること。
  • 提案手法の有効性を、画像分類、自然言語処理、オブジェクト検出を含む多様な深層学習タスクで検証すること。

提案手法

  • EAdamは、Adamアルゴリズムを変更し、$\epsilon$ を学習率の分母ではなく、ランニング分散 $v_t$ の更新に追加する。
  • $v_t$ の更新ルールは $v_t \leftarrow \beta_2 v_{t-1} + (1 - \beta_2)(g_t^2 + \epsilon)$ に変更され、ここで $\epsilon$ は最適化プロセス中に蓄積される。
  • この変更により、分母 $\sqrt{\hat{v}_t} + \epsilon$ が数値的に安定する一方で、勾配の適応的スケーリングが保たれる。
  • この手法は、Adamと同等の計算複雑性を維持しており、追加のハイパーパramータや操作を必要としない。
  • 著者らは、一般化性能や収束性を評価するために、複数のモデルとデータセットを用いてEAdamをAdam、RAdam、Adabeliefと比較した。
  • アルゴリズムはGitHubに実装・公開され、再現性およびコミュニティ利用を目的としている。

実験結果

リサーチクエスチョン

  • RQ1Adam最適化法における $\epsilon$ の配置が、その訓練ダイナミクスおよび一般化性能に与える影響は何か?
  • RQ2分母から分散更新に $\epsilon$ を再配置することで、計算コストを増加させることなく一般化性能が向上するか?
  • RQ3EAdamは、画像分類、自然言語処理、オブジェクト検出といった多様な深層学習タスクにおいて、AdamやRAdam、Adabeliefといった他のAdam変種を上回る性能を発揮するか?
  • RQ4標準的なAdamにおいて $\epsilon$ を直接チューニングすることで、$\epsilon$ の再配置による性能向上を再現できるか?
  • RQ5EAdamの向上効果は、ImageNet、Penn Treebank、PASCAL VOC を含む、さまざまなアーキテクチャやデータセットに対して一貫して有効であるか?

主な発見

  • CIFAR-100では、EAdamはAdamに比べて4%の向上を示し、特に深層モデルにおいて顕著な性能向上を達成した。
  • CIFAR-10では、EAdamは一般化性能が優れたことで知られるAdabeliefと同等の性能を達成した。
  • Penn Treebankにおける2層および3層LSTMの言語モデリングでは、EAdamは2層モデルで最も低い perplexity を達成し、3層モデルでもAdabeliefに近い性能を示した。
  • PASCAL VOC で FPN を搭載した Faster R-CNN を用いたオブジェクト検出では、EAdamは平均平均精度(mAP)80.62を達成し、Adam(71.47)とRAdam(76.58)を上回り、Adabelief(81.02)に非常に近い性能を発揮した。
  • EAdamによる向上効果は、標準的なAdamにおいて $\epsilon$ を直接チューニングするのでは再現できないため、$\epsilon$ の位置がその値そのものよりも重要であることが示された。
  • EAdamは、画像分類、自然言語処理、オブジェクト検出のあらゆるタスクで高速な収束性と優れた一般化性能を示し、適応的最適化における $\epsilon$ の配置の重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。