Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Gradient Descent with Large Learning Rate.

Kangqiao Liu, Liu Ziyin|arXiv (Cornell University)|Dec 7, 2020
Stochastic Gradient Optimization Techniques参考文献 77被引用数 6
ひとこと要約

本稿は、消えない学習率を用いた確率的勾配降下法(SGD)を研究し、2次損失設定下での離散時間SGD(運動量あり・なし)に対して、正確に解ける結果を導出する。安定分布を確立し、実験的観察と結びつけることで、近似誤差、ミニバッチノイズ、鋭い極小値からの脱出、2次精度法の定常分布に関する理論的知見を提供する。

ABSTRACT

As a simple and efficient optimization method in deep learning, stochastic gradient descent (SGD) has attracted tremendous attention. In the vanishing learning rate regime, SGD is now relatively well understood, and the majority of theoretical approaches to SGD set their assumptions in the continuous-time limit. However, the continuous-time predictions are unlikely to reflect the experimental observations well because the practice often runs in the large learning rate regime, where the training is faster and the generalization of models are often better. In this paper, we propose to study the basic properties of SGD and its variants in the non-vanishing learning rate regime. The focus is on deriving exactly solvable results and relating them to experimental observations. The main contributions of this work are to derive the stable distribution for discrete-time SGD in a quadratic loss function with and without momentum. Examples of applications of the proposed theory considered in this work include the approximation error of variants of SGD, the effect of mini-batch noise, the escape rate from a sharp minimum, and and the stationary distribution of a few second order methods.

研究の動機と目的

  • 実際の応用で一般的なが大きな学習率領域におけるSGDの挙動を理解すること。これは連続時間近似ではうまく捉えられていない。
  • 2次損失関数下での離散時間SGD(運動量あり・なし)に対して、正確に解ける結果を導出すること。
  • 理論的予測を実験的観察と結びつけること。特に一般化性能と学習ダイナミクスに関して。
  • 近似誤差、ミニバッチノイズ、鋭い極小値からの脱出の影響を、学習率が消えない領域で分析すること。
  • 提案されたフレームワークを用いて、2次精度SGDの変種の定常分布を特徴づけること。

提案手法

  • 2次損失関数における離散時間SGDのダイナミクスを、確率的差分方程式として形式化する。
  • 解析的手法を用いて、非消える学習率下でのパラメータ更新プロセスの安定分布を導出する。
  • 速度項を含むように確率的差分方程式を拡張することで、運動量をモデルに組み込む。
  • 導出された安定分布を用いて、SGDの変種における近似誤差を分析する。
  • ミニバッチノイズが定常分布および収束行動に与える影響を定量化する。
  • フレームワークを用いて、鋭い極小値からの脱出率を推定し、学習率とノイズスケールとを結びつける。

実験結果

リサーチクエスチョン

  • RQ1非消える学習率を用いた離散時間SGDの安定分布は、2次損失設定下で正確にどのように導出できるか?
  • RQ2運動量の導入が、SGDの定常分布および収束特性にどのように影響を与えるか?
  • RQ3ミニバッチノイズとSGDにおけるパラメータの定常分布の関係は何か?
  • RQ4学習率が非消える領域において、鋭い極小値からの脱出率にどのように影響を与えるか?
  • RQ5提案された理論的フレームワーク下で、2次精度SGDの変種の定常分布は何か?

主な発見

  • 非消える学習率を用いた離散時間SGDの安定分布が、2次損失関数下で正確に導出され、観察された学習ダイナミクスの理論的基盤を提供する。
  • 運動量の導入により、定常分布が変化し、標準的なSGDとは異なる収束性および一般化特性が得られる。
  • ミニバッチノイズは、より広がった定常分布をもたらす。これは、実際の応用で観察される改善された一般化性能を説明する助けとなる。
  • 大きな学習率および高いノイズレベルでは、鋭い極小値からの脱出率が上昇し、実験的観察と整合的である。
  • フレームワークは、複数の2次精度SGDの変種の定常分布を正確に予測でき、標準的なSGDを超えた適用可能性を裏付けた。
  • 理論により、大きな学習率が一般化性能を向上させる理由が説明できる。それは、パラメータ更新における有効なノイズを増加させ、より平坦な極小値に至るからである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。