Skip to main content
QUICK REVIEW

[論文レビュー] New Convergence Aspects of Stochastic Gradient Algorithms

Lam M. Nguyen, Phuong Ha Nguyen|arXiv (Cornell University)|Nov 10, 2018
Stochastic Gradient Optimization Techniques参考文献 20被引用数 11
ひとこと要約

本稿は、強い凸な目的関数の文脈において、確率的勾配降下法(SGD)およびHogwild!のための新しい収束解析を提案する。従来の均一に有界な確率的勾配を仮定する古典的仮定を排除した。勾配の真の勾配に対するノルムの相対的性を活用し、徐々に小さくなる学習率を用いることで、より広い条件下での収束を証明した。これにより、有界な勾配を要しないSGDのための現在の最先端の収束領域が拡張された。

ABSTRACT

The classical convergence analysis of SGD is carried out under the assumption that the norm of the stochastic gradient is uniformly bounded. While this might hold for some loss functions, it is violated for cases where the objective function is strongly convex. In Bottou et al. (2018), a new analysis of convergence of SGD is performed under the assumption that stochastic gradients are bounded with respect to the true gradient norm. We show that for stochastic problems arising in machine learning such bound always holds; and we also propose an alternative convergence analysis of SGD with diminishing learning rate regime. We then move on to the asynchronous parallel setting, and prove convergence of Hogwild! algorithm in the same regime in the case of diminished learning rate. It is well-known that SGD converges if a sequence of learning rates $\{η_t\}$ satisfies $\sum_{t=0}^\infty η_t ightarrow \infty$ and $\sum_{t=0}^\infty η^2_t < \infty$. We show the convergence of SGD for strongly convex objective function without using bounded gradient assumption when $\{η_t\}$ is a diminishing sequence and $\sum_{t=0}^\infty η_t ightarrow \infty$. In other words, we extend the current state-of-the-art class of learning rates satisfying the convergence of SGD.

研究の動機と目的

  • 古典的SGD収束解析の限界、すなわち均一に有界な確率的勾配を仮定するという点を是正する。これは強い凸問題で破綻する条件である。
  • 確率的勾配が真の勾配のノルムに対して相対的に有界である、より弱く現実的である勾配バウンドを仮定し、SGDの収束を確立する。
  • 同じ緩和された仮定と徐々に小さくなる学習率の下で、非同期なHogwild!アルゴリズムの収束を拡張する。
  • 均一な有界性を仮定せず、∑ηₜ = ∞ を満たす単調に減少するステップサイズのみを用いて、強い凸な目的関数におけるSGDの収束を証明する。
  • 標準的な∑ηₜ = ∞および∑ηₜ² < ∞の条件を超えて、収束を保証する学習率シーケンスのクラスを一般化する。

提案手法

  • 新たな勾配バウンド仮定を導入する:E[‖∇f(w;ξ)‖²] ≤ 4L(F(w)−F(w*)) + N/kₜ。これは強い凸な目的関数を有する機械学習問題において自然に成立する。
  • リャプノフ関数のアプローチを用いて、最適解からの期待二乗距離E[‖wₜ₊₁−w*‖²]を分析する。
  • 条件ηₜ ≤ 1/(2LDの下で、再帰的不等式を導出する:E[‖wₜ₊₁−w*‖²] ≤ (1−μηₜ)E[‖wₜ−w*‖²] + ηₜ²(ND/kₜ)。
  • 積分変換による連続時間近似を適用し、M(t) = ∫₀ᵗ μn(x)dxおよびK(t) = ∫₁ᵗ k(x)dxを定義することで、残差項の収束を分析する。
  • 変数変換および代入(x = K⁻¹(y))を用い、離散的再帰をD.6節の結果を用いて解析可能な形に変換し、残差項の収束を証明する。
  • ∑ηₜ = ∞およびηₜ ≤ 1/(2LD)の下で、残差項C(t) → 0(t → ∞)を示すことにより、反復wₜがw*に収束することを確立する。

実験結果

リサーチクエスチョン

  • RQ1強い凸な目的関数に対して、均一に有界な確率的勾配を仮定しないでSGDが収束するか?
  • RQ2確率的勾配が真の勾配ノルムの観点で有界である相対的勾配バウンドのもとでも、SGDの収束は成立するか?
  • RQ3同じ緩和された勾配仮定のもとで、収束解析を非同期なHogwild!アルゴリズムに拡張できるか?
  • RQ4古典的な有界勾配仮定を排除した場合、どの種の徐々に小さくなる学習率がSGDの収束を保証するか?
  • RQ5標準的な∑ηₜ = ∞および∑ηₜ² < ∞の条件を超えて、収束証明を一般化できるか?

主な発見

  • 本稿は、確率的勾配が真の勾配ノルムに対して相対的に有界であるという仮定のもとで、SGDが最適解w*に収束することを証明した。これは、強い凸な目的関数を有する機械学習問題において自然に成立する。
  • 収束は、任意の単調に減少する学習率シーケンス{ηₜ}に対して成立し、∑ₜ₌₀^∞ ηₜ = ∞およびηₜ ≤ 1/(2LD)を満たす限り、古典的な均一有界性を仮定しない。
  • 解析は非同期なHogwild!アルゴリズムにまで拡張され、同じ学習率および勾配バウンド条件のもとで収束が証明された。
  • 著者らは、強い凸な設定において、古典的な有界勾配仮定が収束に必要ではないことを示し、SGDの理論的基盤を広げた。
  • 収束境界における残差項C(t)は、t → ∞ において0に収束することが示され、期待される最適解からの距離が0に近づくことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。