Skip to main content
QUICK REVIEW

[論文レビュー] Gradient descent with momentum --- to accelerate or to super-accelerate?

Goran Nakerst, John Brennan|arXiv (Cornell University)|Jan 17, 2020
Stochastic Gradient Optimization Techniques参考文献 48被引用数 5
ひとこと要約

本稿では、勾配を1ステップ先ではなく、新しいハイパーパrameter σ > g により前方に複数ステップ先の点で評価することにより、勾配降下法における「スーパー加速」を提案する。これは、標準的なネステロフ加速法よりも著しく収束速度を向上させる。2次関数および合成された損失関数の形状、MNISTニューラルネットワークの学習において、最適な σ > 1 が最小化をより速く行う。この利点は、RMSProp や Adam といった適応的最適化手法にも拡張可能である。

ABSTRACT

We consider gradient descent with `momentum', a widely used method for loss function minimization in machine learning. This method is often used with `Nesterov acceleration', meaning that the gradient is evaluated not at the current position in parameter space, but at the estimated position after one step. In this work, we show that the algorithm can be improved by extending this `acceleration' --- by using the gradient at an estimated position several steps ahead rather than just one step ahead. How far one looks ahead in this `super-acceleration' algorithm is determined by a new hyperparameter. Considering a one-parameter quadratic loss function, the optimal value of the super-acceleration can be exactly calculated and analytically estimated. We show explicitly that super-accelerating the momentum algorithm is beneficial, not only for this idealized problem, but also for several synthetic loss landscapes and for the MNIST classification task with neural networks. Super-acceleration is also easy to incorporate into adaptive algorithms like RMSProp or Adam, and is shown to improve these algorithms.

研究の動機と目的

  • Nesterov加速法の1ステップ先の前方評価を越えて、複数ステップ先の前方評価を可能にするように、勾配降下法におけるモーメンタムの改良を目的とする。
  • 複数ステップ先(σ > 1)の点で勾配を評価することで、収束速度が向上するかを調査すること。
  • 2次関数および非2次関数の損失関数において、新しいハイパーパrameter σ の最適値を分析すること。
  • RMSProp や Adam といった適応的最適化手法に対してもスーパー加速を拡張すること。
  • 深層学習モデルの学習において σ を使用するための実用的アドバイスを提供すること。

提案手法

  • 勾配を θ^(i) + σ·m^(i-1) で計算するように変更したモーメンタムアルゴリズムを提案し、σ を新たなハイパーパrameterとして導入する。
  • 連続時間の常微分方程式(ODE)を用いて、モーメンタム法およびネステロフ法を減衰振動子としてモデル化する。
  • 1次元の2次関数損失関数 L(θ) = ½kθ² を用いて、最適な σ を解析的および数値的に導出する。
  • 2次元および約50次元の合成損失関数を用いた数値実験により、異なる σ 値における性能を評価する。
  • 全結合および畳み込みニューラルネットワークを用いた MNIST 分類タスクで、本手法をテストする。
  • RMSProp や Adam の更新式に σ を組み込むことで、本手法を適応的最適化手法へ拡張する。

実験結果

リサーチクエスチョン

  • RQ1Nesterovの前方評価を1ステップから複数ステップ(σ > 1)に拡張することで、最適化における収束速度を著しく向上させることができるか?
  • RQ22次関数損失関数を最小化する際の最適な σ の値は何か?また、学習率および曲率に依存するか?
  • RQ3スーパー加速は、非2次関数の合成損失関数の形状および実世界の深層学習タスク(例:MNIST)においても性能向上をもたらすか?
  • RQ4スーパー加速は、RMSProp や Adam といった適応的最適化手法とどのように作用するか?
  • RQ5スーパー加速が失敗する条件は何か?また、実用上、これらの不安定性をどのように緩和できるか?

主な発見

  • 1次元の2次関数損失関数において、最適な σ は1よりはるかに大きく、kη のほとんどの値に対して σ* ≈ 2–5 となる。これはスーパー加速が収束速度を向上させることを示している。
  • 2次元および約50次元の合成損失形状において、g ≈ 0.9 を超えて σ を増加させると最小化が速くなるが、過剰に大きな σ は非線形性のため、最小点でない点への収束を引き起こす。
  • 全結合および畳み込みニューラルネットワークを用いた MNIST 分類タスクにおいて、σ > 1 のスーパー加速により学習が加速され、収束速度が向上した。
  • RMSProp や Adam といった適応的最適化手法に対しても、本手法は容易に統合可能であり、初期結果では性能向上が観察された。
  • 実用的用途においては、σ ≈ 5 から始め、徐々に σ ≈ 2 に減少させることで不安定性を回避しつつ、高速な収束を維持できる。
  • 超浅い領域(非常に小さな kη)では σ の影響がほとんどなく、非常に非線形な領域(例:一部の合成関数では σ ≳ 4)では、偽の吸引子が出現するため、本手法は失敗する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。