Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Time Analysis of Stochastic Gradient Descent under Markov Randomness

Thinh T. Doan, Lam M. Nguyen|arXiv (Cornell University)|Mar 24, 2020
Stochastic Gradient Optimization Techniques参考文献 19被引用数 11
ひとこと要約

本稿は、勾配がマルコフ過程からサンプリングされる場合の確率的勾配降下法(SGD)の有限時間収束解析を提供し、i.i.d. サンプリングの場合と比較して収束速度が対数因子の範囲内にあることを示している。主な貢献は、有界な反復値や勾配を仮定しないで収束を確立したことであり、その対数因子はマルコフ連鎖の混合時間に依存する。

ABSTRACT

Motivated by broad applications in reinforcement learning and machine learning, this paper considers the popular stochastic gradient descent (SGD) when the gradients of the underlying objective function are sampled from Markov processes. This Markov sampling leads to the gradient samples being biased and not independent. The existing results for the convergence of SGD under Markov randomness are often established under the assumptions on the boundedness of either the iterates or the gradient samples. Our main focus is to study the finite-time convergence of SGD for different types of objective functions, without requiring these assumptions. We show that SGD converges nearly at the same rate with Markovian gradient samples as with independent gradient samples. The only difference is a logarithmic factor that accounts for the mixing time of the Markov chain.

研究の動機と目的

  • 勾配が依存性とバイアスを有するマルコフ過程から生成される場合のSGDの有限時間収束を分析すること。
  • 強化学習のような文脈では現実的でない場合が多い、有界な反復値や有界な勾配といった、先行研究で一般的に用いられる仮定を排除すること。
  • i.i.d. サンプリングの場合とほぼ同等の速さで収束するSGDの収束速度を、混合時間に起因する対数的ペナルティのみを伴って確立すること。
  • 強凸関数、滑らかで誤差バウンド付きの関数、非凸滑らか関数の複数の目的関数クラスにわたる統一的な解析を提供すること。

提案手法

  • 勾配のマルコフ的依存性を考慮した、期待される目的関数値の減少量を抑えるために、新規のリャプノフ型の議論を用いる。
  • 収束速度とノイズの平均化のバランスを取るために、時間に依存するステップサイズ則 α_k = α₀ / √k を導入する。
  • 最終反復 x_R の選択に確率的選択ルールを導入し、確率は 2α_k − Lα_k² に比例させることで、期待される勾配ノルムを有利に制御する。
  • 基礎となるマルコフ連鎖の混合時間を利用し、勾配サンプルのバイアスと分散を制御し、収束バウンドに対数因子を導入する。
  • 反復回数にわたる再帰的不等式と和分の利用により、期待される勾配ノルムの二乗 ∥∇f(x_R)∥²_* のバウンドを確立する。
  • 反復値やコンパクトな可能性領域に関する仮定を避ける一方で、∇f のリプシッツ連続性と勾配サンプルの有界性を仮定する。

実験結果

リサーチクエスチョン

  • RQ1勾配がマルコフ過程からサンプリングされる場合、依存性とバイアスが存在するにもかかわらず、SGDは近似的に最適な収束速度を達成できるか?
  • RQ2マルコフ連鎖の混合時間は、SGDの収束速度にどのように影響するか?
  • RQ3特に強化学習の文脈において、有界な反復値や有界な勾配を仮定しないで収束を確立できるか?
  • RQ4非凸滑らか関数、滑らか関数、強凸関数の目的関数に対して、マルコフ的サンプリング下でのSGDの有限時間収束速度は何か?

主な発見

  • 期待される勾配ノルムの二乗 E[∥∇f(x_R)∥²_*] は、O(1/√T) に加え対数的項が加わる形で有界であり、i.i.d. SGD のレートと対数因子の範囲内で一致する。
  • 収束速度は、i.i.d. ケースと比較して対数因子の範囲内であり、その因子は勾配を生成するマルコフ連鎖の混合時間に依存する。
  • 有界な反復値や有界な勾配を仮定しない分析が可能であり、このような仮定がしばしば不適切となる強化学習のような文脈に適用可能である。
  • 非凸滑らか関数の目的関数に対して、E[∥∇f(x_R)∥²_*] ≤ O(1/√T) を、混合時間に起因する対数的ペナルティとともに達成する。
  • バウンドには初期の最適集合までの距離と勾配サンプルの分散に関連する項が含まれており、これらはステップサイズと混合時間によって制御される。
  • 最終反復 x_R は、2α_k − Lα_k² に比例する非一様確率で選択され、一様選択よりも収束保証が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。