Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Inertia: Disentangling the Effects of Adaptive Learning Rate and Momentum

Zeke Xie, Xinrui Wang|arXiv (Cornell University)|Jun 29, 2020
Stochastic Gradient Optimization Techniques被引用数 13
ひとこと要約

本稿は、Adamにおける適応的学習率とモーメンタムの効果を分離し、適応的学習率が鞍点からの脱出を加速するが鋭い極小値を好むのに対し、モーメンタムは脱出を支援するが極小値選択にほとんど影響しないことを示している。一般化を向上させるために、著者らはパラメータごとにモーメンタムを適応的に調整する新しい最適化手法Adaptive Inertia(Adai)を提案した。この手法は平坦な極小値を明示的に好むことが理論的に保証されており、収束速度を維持したままAdamおよびSGDを凌駆する一般化性能を達成している。

ABSTRACT

Adaptive Moment Estimation (Adam), which combines Adaptive Learning Rate and Momentum, would be the most popular stochastic optimizer for accelerating the training of deep neural networks. However, it is empirically known that Adam often generalizes worse than Stochastic Gradient Descent (SGD). The purpose of this paper is to unveil the mystery of this behavior in the diffusion theoretical framework. Specifically, we disentangle the effects of Adaptive Learning Rate and Momentum of the Adam dynamics on saddle-point escaping and flat minima selection. We prove that Adaptive Learning Rate can escape saddle points efficiently, but cannot select flat minima as SGD does. In contrast, Momentum provides a drift effect to help the training process pass through saddle points, and almost does not affect flat minima selection. This partly explains why SGD (with Momentum) generalizes better, while Adam generalizes worse but converges faster. Furthermore, motivated by the analysis, we design a novel adaptive optimization framework named Adaptive Inertia, which uses parameter-wise adaptive inertia to accelerate the training and provably favors flat minima as well as SGD. Our extensive experiments demonstrate that the proposed adaptive inertia method can generalize significantly better than SGD and conventional adaptive gradient methods.

研究の動機と目的

  • AdamがSGDより収束が速いが一般化性能が劣る理由を、極小値選択および鞍点からの脱出という観点から解明すること。
  • 拡散理論を用いて、Adamのダイナミクスにおける適応的学習率とモーメンタムの独立的役割を解体すること。
  • AdamがSGDよりも鋭い極小値を探索するという経験的観察を説明すること。
  • Adamの高速収束を維持しつつ、平坦な極小値を好むことで一般化性能を向上させる新しい最適化フレームワークを設計すること。
  • 理論的および実験的に、Adaptive Inertia(Adai)が鞍点からの迅速な脱出と平坦な極小値の選択を保証でき、SGDと同等の一般化性能を達成することを検証すること。

提案手法

  • 著者らは、最適化を連続時間のランジュバン過程として扱う拡散フレームワークにおいて、Adamのダイナミクスを確率的微分方程式(SDE)でモデル化した。
  • Adamを2つの要素に分解:適応的学習率(非等方的拡散としてモデル化)とモーメンタム(移動項としてモデル化)、それぞれが鞍点からの脱出および極小値選択に与える影響を個別に分析した。
  • Fokker-Planck方程式および拡散行列解析を用いて、適応的学習率が高速な鞍点脱出を可能にするが平坦な極小値を好まないのに対し、モーメンタムは脱出を支援する移動項を提供するが極小値の鋭さにほとんど影響しないことを証明した。
  • この分析に基づき、パラメータごとに適応的モーメンタム(慣性)を導入するAdaptive Inertia(Adai)を提案した。慣性係数は勾配の大きさの移動平均に基づいて調整される。
  • Adaiは、時間変動するパラメータ固有の慣性項を有する修正されたモーメンタム更新として定式化され、最適化ダイナミクスのニュートン運動の類推に基づく。
  • 安定かつ分離された重み減衰バージョン(AdaiS/AdaiW)として実装されており、標準的な訓練手法と互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1Adamにおける適応的学習率とモーメンタムは、それぞれ鞍点からの脱出および平坦な極小値選択にどのように影響するか?
  • RQ2AdamはSGDより収束が速いが、なぜ一般化性能が劣るのか?(SGDは優れた一般化性能を示すが)
  • RQ3Adamのダイナミクスを分離し、適応的学習率とモーメンタムの最適化行動への寄与を明確にできるか?
  • RQ4高速収束(適応的学習率由来)と良好な一般化(平坦な極小値選択由来)を併せ持つ新しい最適化フレームワークを設計できるか?
  • RQ5パラメータごとの適応的モーメンタム機構(Adaptive Inertia)は、平坦な極小値を明示的に好むことが理論的に保証され、かつ高速な鞍点脱出を維持できるか?

主な発見

  • 適応的学習率は鞍点からの迅速な脱出を可能にするが、平坦な極小値を好まない。これにより、AdamがSGDよりも鋭い極小値を探索する理由が説明される。
  • モーメンタムは脱出を支援する移動項を提供するが、平坦極小値対鋭い極小値の選択にほとんど影響しない。
  • Adaptive Inertia(Adai)は、理論的に鞍点からの迅速な脱出と平坦な極小値の選択を保証しており、SGDと同等の一般化性能を達成する。
  • 広範な実験により、ResNetおよびビジョントランスフォーマーのアーキテクチャを用いたCIFAR-10、CIFAR-100、ImageNetにおいて、AdaiはAdamおよびSGDよりも顕著に優れた一般化性能を示した。
  • 期待される極小値の鋭さの分析から、AdaiとSGDはAdamよりも平坦な極小値を学習しており、Adaiは重みの摂動に対して高いロバスト性を示した。
  • AdaiはSGDよりも収束が速く、一般化性能は同等またはそれを上回り、複数のベンチマークでテスト精度においてAdamを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。