Skip to main content
QUICK REVIEW

[論文レビュー] Backtracking Gradient Descent allowing unbounded learning rates

Tuyen Trung Truong|arXiv (Cornell University)|Jan 7, 2020
Stochastic Gradient Optimization Techniques参考文献 4被引用数 6
ひとこと要約

本稿では、関数 $ h $ に特定の減衰条件が課された場合に、学習率を無限大に発散させるのを許容するバックトラッキング勾配降下法の変種、無限大バックトラッキング勾配降下法を提案する。この手法は、臨界点への収束を保証しつつ、学習率が有界でない場合の理論的安定性を向上させる。主な貢献は、先行研究と同様の一般的な条件下で収束を示すが、今後は学習率の有界性を仮定しないため、悪い局所最小値からの脱出に向けた理論的強化を実現する。

ABSTRACT

In unconstrained optimisation on an Euclidean space, to prove convergence in Gradient Descent processes (GD) $x_{n+1}=x_n-δ_n abla f(x_n)$ it usually is required that the learning rates $δ_n$'s are bounded: $δ_n\leq δ$ for some positive $δ$. Under this assumption, if the sequence $x_n$ converges to a critical point $z$, then with large values of $n$ the update will be small because $||x_{n+1}-x_n||\lesssim || abla f(x_n)||$. This may also force the sequence to converge to a bad minimum. If we can allow, at least theoretically, that the learning rates $δ_n$'s are not bounded, then we may have better convergence to better minima. A previous joint paper by the author showed convergence for the usual version of Backtracking GD under very general assumptions on the cost function $f$. In this paper, we allow the learning rates $δ_n$ to be unbounded, in the sense that there is a function $h:(0,\infty) ightarrow (0,\infty )$ such that $\lim _{t ightarrow 0}th(t)=0$ and $δ_n\lesssim \max \{h(x_n),δ\}$ satisfies Armijo's condition for all $n$, and prove convergence under the same assumptions as in the mentioned paper. It will be shown that this growth rate of $h$ is best possible if one wants convergence of the sequence $\{x_n\}$. A specific way for choosing $δ_n$ in a discrete way connects to Two-way Backtracking GD defined in the mentioned paper. We provide some results which either improve or are implicitly contained in those in the mentioned paper and another recent paper on avoidance of saddle points.

研究の動機と目的

  • 標準的およびバックトラッキング勾配降下法における学習率の有界性という制限を是正し、悪質な局所最小値への収束を回避すること。
  • バックトラッキング勾配降下法において理論的に無限大に発散する学習率を許容しつつ、臨界点への収束を維持すること。
  • 学習率の上界を制御する関数 $ h $ の成長率が収束に最適であることを確立すること。
  • 目的関数に最小限の仮定を課した状態で、有界な学習率の枠組みから無限大の学習率の枠組みへ収束結果を一般化すること。
  • 無限大バックトラッキング勾配降下法の実用的で離散的な実装を提示し、Two-way Backtracking GD と関連付けること。

提案手法

  • 関数 $ h:(0,∞)\to(0,∞) $ を導入し、$ \lim_{t\to 0} t h(t) = 0 $ を満たすように定義し、学習率の上界を制御する。
  • $ \delta(x) \leq \hat{\delta}(x) \leq h(\|\nabla f(x)\|) $ を満たす任意の $ \hat{\delta}(x) $ を定義し、アーミジョ条件を満たすようにする。
  • 更新則 $ x_{n+1} = x_n - \hat{\delta}(x_n) \nabla f(x_n) $ を構築し、勾配が小さい場合に学習率を増大可能にする。
  • 離散的アルゴリズムを用いる:初期値 $ \delta = \delta_0 $ から開始し、アーミジョ条件を満たさない場合は $ \beta $ で減少させ、満たす場合で $ \delta \leq h(\|\nabla f(x_n)\|) $ であれば $ 1/\beta $ で増加させる。
  • コンパクト性の議論と $ h $ の減衰条件を用いて、収束下で $ \|x_{n+1} - x_n\| \to 0 $ を示す。
  • 先行研究における鞍点回避と収束に関する結果を応用し、$ C^1 $ 関数で臨界点が可算個である場合に一般化する。

実験結果

リサーチクエスチョン

  • RQ1学習率が無限大に発散するのを許容する場合、バックトラッキング勾配降下法は臨界点に収束するか?
  • RQ2収束を保証するための、学習率の上界を制御する関数 $ h $ の最小成長率は何か?
  • RQ3提案された無限大バックトラッキング勾配降下法は、標準的バックトラッキング勾配降下法と同等の仮定のもとで収束保証を維持するか?
  • RQ4無限大バックトラッキング勾配降下法の離散的実装は、既存の理論枠組みで正当化可能か?
  • RQ5$ \lim_{t\to 0} t h(t) = 0 $ という条件は、$ \|x_{n+1} - x_n\| \to 0 $ を保証するのに最適か?

主な発見

  • 関数 $ f $ が高々可算個の臨界点しか持たない場合、無限大バックトラッキング勾配降下法によって生成される列 $ \{x_n\} $ は、臨界点に収束するか、無限大に発散する。
  • 関数 $ f $ が $ C^1 $ であり、列 $ \{x_n\} $ がクラスタ点を持つならば、その点は $ f $ の臨界点でなければならない。
  • 列 $ \{x_n\} $ に対して $ \|x_{n+1} - x_n\| \to 0 $ が成り立つが、$ f(x_n) \to -\infty $ でない限り。
  • 関数 $ h $ の成長率、すなわち $ \lim_{t\to 0} t h(t) = 0 $ は、列 $ \{x_n\} $ の収束を保証するのに最適である。
  • Two-way Backtracking GD に類似した離散的アルゴリズムは、先行研究と同等の仮定のもとで収束を保証する。
  • 先行研究における鞍点回避に関する理論的結果は、$ \nabla f $ に一様リプシッツ連続性を仮定しないまま、無限大学習率の枠組みへ拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。