Skip to main content
QUICK REVIEW

[論文レビュー] Sample Complexity Bounds for Two Timescale Value-based Reinforcement Learning Algorithms

Tengyu Xu, Yingbin Liang|arXiv (Cornell University)|Nov 10, 2020
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿は、定常ステップサイズを用いたマーカフオリアンサンプリング下で、2タイムスケール価値ベース強化学習アルゴリズム—線形および非線形TDC、およびGreedy-GQ—の非漸近的収束解析を初めて提供する。線形TDCの最適なサンプル複雑度$\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$と非線形TDCおよびGreedy-GQの$\mathcal{O}(\epsilon^{-2})$を確立し、従来の結果を著しく改善し、広く使われているRLアルゴリズムにおける実用的な有限サンプル保証を提供する。

ABSTRACT

Two timescale stochastic approximation (SA) has been widely used in value-based reinforcement learning algorithms. In the policy evaluation setting, it can model the linear and nonlinear temporal difference learning with gradient correction (TDC) algorithms as linear SA and nonlinear SA, respectively. In the policy optimization setting, two timescale nonlinear SA can also model the greedy gradient-Q (Greedy-GQ) algorithm. In previous studies, the non-asymptotic analysis of linear TDC and Greedy-GQ has been studied in the Markovian setting, with diminishing or accuracy-dependent stepsize. For the nonlinear TDC algorithm, only the asymptotic convergence has been established. In this paper, we study the non-asymptotic convergence rate of two timescale linear and nonlinear TDC and Greedy-GQ under Markovian sampling and with accuracy-independent constant stepsize. For linear TDC, we provide a novel non-asymptotic analysis and show that it attains an $\\epsilon$-accurate solution with the optimal sample complexity of $\\mathcal{O}(\\epsilon^{-1}\\log(1/\\epsilon))$ under a constant stepsize. For nonlinear TDC and Greedy-GQ, we show that both algorithms attain $\\epsilon$-accurate stationary solution with sample complexity $\\mathcal{O}(\\epsilon^{-2})$. It is the first non-asymptotic convergence result established for nonlinear TDC under Markovian sampling and our result for Greedy-GQ outperforms the previous result orderwisely by a factor of $\\mathcal{O}(\\epsilon^{-1}\\log(1/\\epsilon))$.

研究の動機と目的

  • 実際の応用で標準的であるが有限サンプル保証が欠如している定常ステップサイズ下での2タイムスケール価値ベースRLの非漸近的収束解析のギャップを埋めること。
  • 非線形TDCのマーカフオリアンサンプリング下での非漸近的収束レートを、これまで非漸近的解析が存在しなかった設定で初めて確立すること。
  • 定常ステップサイズ下でのGreedy-GQのサンプル複雑度を、従来の減少ステップサイズまたは$\epsilon$依存ステップサイズの結果を上回るように改善し、$\mathcal{O}(\epsilon^{-2})$を達成すること。
  • 強化学習における方策評価および最適化問題のための線形および非線形2タイムスケール確率的近似(SA)の分析を統一すること。

提案手法

  • マーカフオリアンサンプリングと定常ステップサイズ下での2タイムスケール確率的近似(SA)のための新しい非漸近的解析フレームワークを構築する。
  • リャプノフ関数技術と再帰的不等式を用いて、反復値の最適解からの期待二乗誤差を評価する。
  • 高速および低速タイムスケールの相互作用を的確に分析することで収束レートを確立し、特に高速変数からの誤差伝播が低速変数に与える影響を重点的に検討する。
  • 式(59)に新たに導入された重要な不等式により、低速変数の累積誤差を高速変数の追跡誤差および勾配ノルムで上界で抑えられる。
  • グローバル安定性や局所線形化条件といった制限的な仮定を最小限に抑え、非線形関数近似へのより広範な適用可能性を実現する。
  • 反復回数$T$と所望の精度$\epsilon$との関係を、平均勾配ノルムを収束指標として用いることで、サンプル複雑度の境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1マーカフオリアンサンプリング下で定常ステップサイズを用いた線形TDCの非漸近的サンプル複雑度は何か?
  • RQ2非線形TDCがマーカフオリアンサンプリングと定常ステップサイズの下で非漸近的収束レートを達成できるか?(従来の有限サンプル解析が存在しなかった設定である。)
  • RQ3定常ステップサイズを用いたGreedy-GQのサンプル複雑度は、減少または$\epsilon$依存ステップサイズを用いた従来の結果と比較してどうなるか?
  • RQ4局所線形化やグローバル安定性といった制限的仮定を課さずに、非線形2タイムスケールSAへの分析を拡張可能か?
  • RQ5実用的なサンプリング条件下での2タイムスケールRLアルゴリズムにおいて、ステップサイズ選択と収束レートの最適なトレードオフは何か?

主な発見

  • 線形TDCアルゴリズムは、定常ステップサイズ下で$\epsilon$-精度解を達成するサンプル複雑度$\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$を達成し、これが最適である。
  • 非線形TDCに関しては、マーカフオリアンサンプリング下で初めて非漸近的収束結果が確立され、サンプル複雑度は$\mathcal{O}(\epsilon^{-2})$である。
  • Greedy-GQアルゴリズムは定常ステップサイズ下でサンプル複雑度$\mathcal{O}(\epsilon^{-2})$を達成し、従来の結果を$\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$の要因で上回る。
  • 局所線形化やグローバル安定性といった制限的仮定を課さずに分析が成立し、一般の非線形関数近似に適用可能である。
  • 収束レートは定常ステップサイズを用いて導出されており、実世界のRLアプリケーションで一般的に使用される実用的である。
  • 導出された境界はタイトであり、マーカフオリアンサンプリング下での非凸確率的最適化の理論的下界と一致する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。