Skip to main content
QUICK REVIEW

[論文レビュー] Does Adam optimizer keep close to the optimal point?

Kiwook Bae, Heechang Ryu|arXiv (Cornell University)|Nov 1, 2019
Stochastic Gradient Optimization Techniques参考文献 11被引用数 18
ひとこと要約

本稿では、1点凸領域において、2次モーメント推定値が小さいために有効学習率が大きくなりすぎることで、Adamが最適解の近くにとどまらなくなることを示している。これを解決するために、著者らはAdaFixを提案する。AdaFixは、2次モーメント推定値が安定したのちにそれを固定することで、最適解の近くでの収束性と安定性を保証し、MNISTおよびCIFAR-10においてAdamや他の適応的最適化手法を上回る性能を発揮する。

ABSTRACT

The adaptive optimizer for training neural networks has continually evolved to overcome the limitations of the previously proposed adaptive methods. Recent studies have found the rare counterexamples that Adam cannot converge to the optimal point. Those counterexamples reveal the distortion of Adam due to a small second momentum from a small gradient. Unlike previous studies, we show Adam cannot keep closer to the optimal point for not only the counterexamples but also a general convex region when the effective learning rate exceeds the certain bound. Subsequently, we propose an algorithm that overcomes Adam's limitation and ensures that it can reach and stay at the optimal point region.

研究の動機と目的

  • Adamが一部のケースで収束しているにもかかわらず、最適解の近くにとどまらない理由を特定すること。
  • 最適解が局所的に凸である1点凸領域におけるAdamの不安定性を分析すること。
  • 最適領域からの発散を防ぐために2次モーメント推定値に課すべき理論的境界を導出すること。
  • 最適解の近くでの収束性と安定性を保証する新しい適応的最適化手法AdaFixを設計すること。
  • 標準的な視覚ベンチマークにおいて、AdaFixがAdam、AMSGrad、AdaBoundを上回ることを検証すること。

提案手法

  • 著者らは、勾配が常に最適解に向かって一貫して向かう1点凸性仮定の下でAdamの挙動を分析する。
  • 有効学習率 $\eta / \sqrt{\hat{v}_t}$ が大きくなりすぎないよう、2次モーメント推定値 $\hat{v}_t$ に理論的境界を導出する。
  • AdaFixは、$\hat{v}_t$ が安定し、十分に小さい値に達した段階でそれを固定することで、小さな勾配による学習率の爆発を防ぐ。
  • 訓練軌道に沿って、勾配の差分とパラメータ更新量の比を用いてL-スムーズ定数 $L$ を近似する。
  • 固定された $\hat{v}_t$ を用いることで、有効学習率を安定化させ、発散とアンダーフィッティングの両方を回避する。
  • AdaFixは、複数のアーキテクチャを用いてMNISTおよびCIFAR-10で評価され、Adam、AMSGrad、AdaBound、SGDMと比較された。

実験結果

リサーチクエスチョン

  • RQ1Adamは、1点凸領域において最適解に到達したとしても、その周辺にとどまることができるか?
  • RQ2理論的には収束しているにもかかわらず、Adamが最適領域から発散する原因は何か?
  • RQ3Adamが最適領域から逃れるのを防ぐために、2次モーメント推定値に課すべき理論的境界は何か?
  • RQ4適応的学習率をどのように安定化すれば、最適解の近くでの収束性と安定性を両立できるか?
  • RQ5改良された適応的最適化手法は、標準的な視覚ベンチマークでAdamおよびその変種を上回ることができるか?

主な発見

  • AdaFixは2層MLPを用いてMNISTで98.75% ± 0.02のテスト精度を達成し、Adam(98.70% ± 0.03)を上回った。
  • データ拡張なしのCIFAR-10において、AdaFixはDenseNet53で90.25% ± 0.19の精度を達成し、Adam(90.07% ± 0.04)を上回った。
  • データ拡張ありの状況では、AdaFixはDenseNet53で93.51% ± 0.17の精度に達し、SGDMや他の適応的手法と同等またはそれを上回った。
  • 図2は、Adamの$||v||_2$が非常に小さくなり、結果として有効学習率が爆発的になり、テスト精度が振動することを示しているのに対し、AdaFixは学習率を安定化させた。
  • AMSGradは学習率の爆発を防ぐが、有効学習率が小さくなりすぎてしまうのに対し、AdaFixは安定性と効率性の両立に成功した。
  • 理論的分析から、$\delta \ll L$ の場合、有効学習率の境界はおおよそ $L\eta$ になると示された。これは、$\hat{v}_t$ が安定した段階で固定する必要があることを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。