Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotic behaviour of learning rates in Armijo's condition

Tuyen Trung Truong, Tuan Hang Nguyen|arXiv (Cornell University)|Jul 7, 2020
Stochastic Gradient Optimization Techniques参考文献 5被引用数 5
ひとこと要約

本稿は、バックトラッキング勾配ディセンションにおけるアルミョイの条件における学習率の漸近的挙動を分析する。収束先が非退化臨界点である場合、学習率は有界でなければならないことを証明し、その上限をヘッセ行列のノルムとその逆行列のノルムを用いて明示的な定量的評価を与える。これは、非退化最小値付近では有界でないバックトラッキングGDが、標準バックトラッキングGDと同様の挙動を示すが、退化した点では著しく異なる挙動を示すことを示している。

ABSTRACT

Fix a constant $00$, we say that Armijo's condition is satisfied if $f(x-δ abla f(x))-f(x)\leq -αδ|| abla f(x)||^2$. It is a basis for the well known Backtracking Gradient Descent (Backtracking GD) algorithm. Consider a sequence $\{x_n\}$ defined by $x_{n+1}=x_n-δ_n abla f(x_n)$, for positive numbers $δ_n$ for which Armijo's condition is satisfied. We show that if $\{x_n\}$ converges to a non-degenerate critical point, then $\{δ_n\}$ must be bounded. Moreover this boundedness can be quantified in terms of the norms of the Hessian $ abla ^2f$ and its inverse at the limit point. This complements the first author's results on Unbounded Backtracking GD, and shows that in case of convergence to a non-degenerate critical point the behaviour of Unbounded Backtracking GD is not too different from that of usual Backtracking GD. On the other hand, in case of convergence to a degenerate critical point the behaviours can be very much different. We run some experiments to illustrate that both scenrios can really happen. In another part of the paper, we argue that Backtracking GD has the correct unit (according to a definition by Zeiler in his Adadelta's paper). The main point is that since learning rate in Backtracking GD is bound by Armijo's condition, it is not unitless.

研究の動機と目的

  • 非退化臨界点に収束する際、学習率が無限大に発散し続けるUnbounded Backtracking GDが可能かどうかを調査すること。
  • 非退化および退化臨界点付近における、Unbounded Backtracking GDと標準バックトラッキングGDの学習率の漸近的挙動を比較すること。
  • 物理的次元解析に基づき、バックトラッキングGDの単位の整合性を確立し、標準的および適応的手法の主な限界を解消すること。
  • 特に、極限点におけるヘッセ行列の性質と関連して、アルミョイの条件の下でのバックトラッキングGDの収束挙動に対する理論的裏付けを提供すること。

提案手法

  • 非退化臨界点 $x_\infty$ の周囲における $f$ と $\nabla f$ のテイラー展開を用いて、$f(x_n) - f(x_\infty)$ および $\|\nabla f(x_n)\|$ の漸近的推定を導出する。
  • 学習率 $\delta_n$ の上界を導くために、アルミョイの条件 $f(x_n - \delta_n \nabla f(x_n)) - f(x_n) \leq -\alpha \delta_n \|\nabla f(x_n)\|^2$ を適用する。
  • 極限点におけるヘッセ行列 $\nabla^2 f(x_\infty)$ 及びその逆行列の作用素ノルム推定を用いて、$\delta_n$ の上界を定量的に評価する。
  • 次元整合性を用いた単位解析:$\delta(x_n)$ が単位 $\text{Unit}(x)^2 / \text{Unit}(f)$ を持ち、アルミョイの条件が単位整合性を持つのは $\alpha$ が無次元である場合に限ることを示す。
  • バックトラッキングGDを標準GD、モーメンタム法、Adagrad、ニュートン法、徐々に減少するGDと比較し、単位整合性の観点から検討する。
  • 数値実験を通じて、臨界点の性質に応じて、実際に有界および無限大に発散する学習率の両方の挙動が生じうることを示す。

実験結果

リサーチクエスチョン

  • RQ1Unbounded Backtracking GD において、非退化臨界点に収束する際、学習率が無限大に発散し続けることは可能か?
  • RQ2極限点におけるヘッセ行列およびその逆行列を用いて、学習率 $\delta_n$ の定量的上界はどのように表されるか?
  • RQ3非退化臨界点と退化臨界点に収束する場合に、Unbounded Backtracking GD と標準バックトラッキングGD の挙動にどのような違いが生じるか?
  • RQ4Zeilerの単位解析に基づくと、バックトラッキングGDは単位整合性を満たしているか?他の最適化手法と比較するとどうなるか?
  • RQ5バックトラッキングGDにおける学習率は、関数スケールに依存せずに選べるのか?その結果、収束性および安定性にどのような影響があるか?

主な発見

  • 学習率 $\delta_n$ が有界である必要がある。すなわち、$\{x_n\}$ が $x_{n+1} = x_n - \delta_n \nabla f(x_n)$ で定義され、アルミョイの条件を満たし、非退化臨界点に収束する場合、$\delta_n$ は有界でなければならない。
  • 上界は $\|\nabla^2 f(x_\infty)\|$ と $\|\nabla^2 f(x_\infty)^{-1}\|$ によって定量的に制御され、$n$ が十分に大きい場合に $\alpha \delta_n \leq \frac{1}{2}(\|\nabla^2 f(x_\infty)\| + \epsilon)(\|\nabla^2 f(x_\infty)^{-1}\| + \epsilon)^2$ が成り立つ。
  • 一方、退化臨界点に収束する場合、Unbounded Backtracking GD の学習率は無限大に発散しうるため、非退化点とは本質的に異なる挙動を示す。
  • バックトラッキングGDは単位整合性を満たす:学習率 $\delta(x_n)$ の単位は $\text{Unit}(x)^2 / \text{Unit}(f)$ であり、アルミョイの条件が単位整合性を持つのは $\alpha$ が無次元である場合に限る。
  • 標準GDと徐々に減少するGDは単位整合性を満たさないが、ニュートン法は満たすが、下降法であるとは限らない。
  • 標準GDにおける $\delta_0 = 1/L$($L$ は $\nabla f$ のリプシッツ定数)の選択は単位整合性を満たし、これはバックトラッキングGDの特別な場合である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。