Skip to main content
QUICK REVIEW

[論文レビュー] Convergence Rates of Accelerated Markov Gradient Descent with Applications in Reinforcement Learning

Thinh T. Doan, Lam M. Nguyen|arXiv (Cornell University)|Feb 7, 2020
Stochastic Gradient Optimization Techniques参考文献 41被引用数 13
ひとこと要約

本稿では、i.i.d. ランダムサンプルではなく、マーカフ過程から抽出された勾配を使用する、加速された確率的勾配降下法の変種である加速マーカフ勾配降下法(AMGD)を提案する。偏りと相関のある勾配にもかかわらず、AMGDはi.i.d.の場合と同程度の収束速度を達成し、その要因はマーカフ連鎖の混合時間に依存する。強化学習のベンチマークにおいて、顕著なサンプル効率の向上を示した。

ABSTRACT

Motivated by broad applications in machine learning, we study the popular accelerated stochastic gradient descent (ASGD) algorithm for solving (possibly nonconvex) optimization problems. We characterize the finite-time performance of this method when the gradients are sampled from Markov processes, and hence biased and dependent from time step to time step; in contrast, the analysis in existing work relies heavily on the stochastic gradients being independent and sometimes unbiased. Our main contributions show that under certain (standard) assumptions on the underlying Markov chain generating the gradients, ASGD converges at the nearly the same rate with Markovian gradient samples as with independent gradient samples. The only difference is a logarithmic factor that accounts for the mixing time of the Markov chain. One of the key motivations for this study are complicated control problems that can be modeled by a Markov decision process and solved using reinforcement learning. We apply the accelerated method to several challenging problems in the OpenAI Gym and Mujoco, and show that acceleration can significantly improve the performance of the classic temporal difference learning and REINFORCE algorithms.

研究の動機と目的

  • 勾配がマーカフ過程によって生成される場合に生じるバイアスと時系列的依存性が生じる中で、加速された確率的勾配降下法の理論的ギャップを埋めること。
  • 基礎的なマーカフ連鎖に関する標準的仮定の下で、加速マーカフ勾配降下法(AMGD)の収束速度を確立すること。
  • 強化学習設定において、軌道サンプリングにより自然にマーカフ的勾配が生じるが、その中で加速が有効であることを示すこと。
  • 標準的な時系列差分学習やREINFORCEと比較して、AMGDがはるかに少ないサンプル数で収束することを示し、理論的境界と整合させること。

提案手法

  • 定常分布πをもつ一様マーカフ連鎖からサンプリングされる勾配に適応したネステロフの加速勾配法の変種としてAMGDを提案する。
  • 凸かつ滑らか、強凸、非凸かつ滑らかの3つの関数クラスについて、マーカフ連鎖に関する標準的仮定の下で収束を分析する。
  • 収束境界に混合時間に依存する対数因子を導入し、マーカフ的依存性が収束速度に与える影響を定量化する。
  • リャプノフ関数を用いたアプローチと再帰的不等式を用いて、期待値の最適でない差f(x̄_k) - f(x*)を混合時間とステップサイズの系列に関してバウンディングする。
  • 時間依存のステップサイズγ_k = 2/(μ(k+1)) とモーメンタムパラメータα_k = 2kを用い、ネステロフ法の再帰関係を満たす。
  • 混合時間τ(γ_k)と連鎖の混合性に関する項に分解することで、期待誤差の境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1勾配がi.i.d.サンプルではなくマーカフ過程から抽出される場合に、加速された確率的勾配降下法が、近似的に最適な収束速度を維持できるか?
  • RQ2非凸かつ滑らかな最適化において、マーカフ連鎖の混合時間が加速手法の収束速度にどのように影響するか?
  • RQ3時系列差分学習やREINFORCEのような強化学習アルゴリズムにおいて、加速がどの程度サンプル効率を向上させるか?
  • RQ4マーカフ決定過程における従属的・バイアスのある勾配サンプリングに対し、加速手法の理論的収束保証を拡張できるか?

主な発見

  • 非凸かつ滑らかな目的関数に対して、AMGDはO(log(k)/k)の収束速度を達成し、マーカフ連鎖の混合時間に関連する対数因子を除き、i.i.d.の場合と同等の性能を示す。
  • 強凸関数に対しては、期待値の最適でない差f(x̄_k) - f(x*)がO(1/k²)でバウンデッドされ、対数因子は混合時間に起因するが、既知のi.i.d.レートと一致する。
  • OpenAI GymおよびMuJoCo環境における実験では、TD学習およびREINFORCEのAMGD版が、同等のポリシー性能に到達するためのサンプル数を著しく削減した。
  • 理論的境界にはlog(μ(k+1)/2)に比例する項が含まれており、これがマーカフ的サンプリングの影響を捉えており、収束の早さが実験的にも裏付けられている。
  • 分析により、マーカフ的勾配のバイアスと依存性が、加速の収束速度を対数因子を超えて劣化させないことが示された。
  • 実験結果により、加速が実際の応用において顕著に有効であることが確認され、AMGDはベースライン手法と比較して最大50%の少ないサンプル数で、より高い報酬を得るポリシーを学習した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。