Skip to main content
QUICK REVIEW

[論文レビュー] Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling

Huaqing Xiong, Tengyu Xu|arXiv (Cornell University)|Feb 15, 2020
Reinforcement Learning in Robotics参考文献 65被引用数 11
ひとこと要約

本稿は、マルコフ的サンプリング下でのアダムタイプ強化学習アルゴリズム—PG-AMSGradおよびTD-AMSGrad—に対する、初めての非漸近的収束解析を提示する。減衰するステップサイズを用いる場合、収束速度は $Θ(\log^2 T / \sqrt{T})$ で静的点に収束し、定数ステップサイズを用いる場合、最適解の近傍に $Θ(1/T)$ の速度で収束する。それぞれ一般非線形関数近似および線形関数近似の下で成立する。

ABSTRACT

Despite the wide applications of Adam in reinforcement learning (RL), the theoretical convergence of Adam-type RL algorithms has not been established. This paper provides the first such convergence analysis for two fundamental RL algorithms of policy gradient (PG) and temporal difference (TD) learning that incorporate AMSGrad updates (a standard alternative of Adam in theoretical analysis), referred to as PG-AMSGrad and TD-AMSGrad, respectively. Moreover, our analysis focuses on Markovian sampling for both algorithms. We show that under general nonlinear function approximation, PG-AMSGrad with a constant stepsize converges to a neighborhood of a stationary point at the rate of $\mathcal{O}(1/T)$ (where $T$ denotes the number of iterations), and with a diminishing stepsize converges exactly to a stationary point at the rate of $\mathcal{O}(\log^2 T/\sqrt{T})$. Furthermore, under linear function approximation, TD-AMSGrad with a constant stepsize converges to a neighborhood of the global optimum at the rate of $\mathcal{O}(1/T)$, and with a diminishing stepsize converges exactly to the global optimum at the rate of $\mathcal{O}(\log T/\sqrt{T})$. Our study develops new techniques for analyzing the Adam-type RL algorithms under Markovian sampling.

研究の動機と目的

  • マルコフ的サンプリング下でのアダムタイプ強化学習アルゴリズムに対する、初めての非漸近的収束保証を確立すること。これは、現実世界の強化学習設定で一般的に見られる。
  • ポリシー勾配法および時系列差分学習の両方において、非i.i.d.なサンプルから生じる勾配推定のバイアスという課題に、適応的モーメンタム更新の下で取り組むこと。
  • 時間的に変化する非i.i.d.なサンプリングプロセス下で、AMSGrad更新におけるバイアスと分散を制御するための新しい解析的手法を開発すること。
  • 既存のバニラPG解析を改善し、適応的なツールを用いてマルコフ的サンプリング下でよりタイトな収束速度を導出すること。
  • 一般関数近似および線形関数近似の下で、定数ステップサイズおよび減衰するステップサイズスケジュールの両方に対して、PG-AMSGradおよびTD-AMSGradの収束速度を提供すること。

提案手法

  • PG-AMSGradおよびTD-AMSGradを、ポリシー勾配法および時系列差分学習にアダムの改良版であるAMSGradの適応的更新ルールを適用した拡張として提案する。
  • 非i.i.d.なサンプリングおよび適応的モーメンタムの下でも、ステップサイズに比例して勾配推定誤差を制限する、新しいバイアス制御機構を導入する。
  • PG-AMSGradにおいて、時間的に変化するポリシーとマルコフ遷移の影響を分離するために、参照プロセスを用いたカップリング技術を採用する。
  • 幾何級数のバウンドと、補題14および17によるモーメント制御を用いて、AMSGradにおける適応的学習率のダイナミクスを扱う。
  • 最終出力反復の収束速度を導出するために、ジェンセンの不等式と反復値の平均化を用いる。
  • 勾配ノルム、関数近似、混合時間に関する仮定を活用し、解析におけるバイアス項と分散項を制限する。

実験結果

リサーチクエスチョン

  • RQ1ポリシー勾配法および時系列差分学習におけるアダムタイプ更新は、マルコフ的サンプリング下でも非漸近的収束を達成できるか?
  • RQ2一般非線形関数近似および線形関数近似の下で、定数ステップサイズおよび減衰するステップサイズを用いたPG-AMSGradおよびTD-AMSGradの収束速度は何か?
  • RQ3非i.i.d.なサンプリングおよび適応的モーメンタムによって生じるバイアスは、強化学習アルゴリズムで形式的にどのように境界づけられ、制御できるか?
  • RQ4提案された解析手法は、マルコフ的サンプリング下でのバニラポリシー勾配法の収束速度を改善できるか?
  • RQ5サンプリングがi.i.d.でない場合、強化学習における適応的最適化の理論的限界は何か?

主な発見

  • 一般非線形関数近似の下で、定数ステップサイズを用いたPG-AMSGradは、静的点の近傍に $Θ(1/T)$ の速度で収束する。
  • 減衰するステップサイズ $\alpha_t = \alpha / \sqrt{t}$ を用いたPG-AMSGradは、静的点に正確に $Θ(\log^2 T / \sqrt{T})$ の速度で収束する。
  • 線形関数近似の下で、定数ステップサイズを用いたTD-AMSGradは、グローバル最適解の近傍に $Θ(1/T)$ の速度で収束する。
  • 線形関数近似の下で、減衰するステップサイズを用いたTD-AMSGradは、グローバル最適解に正確に $Θ(\log T / \sqrt{T})$ の速度で収束する。
  • 本解析は、非i.i.d.なサンプリングおよび適応的モーメンタムからのバイアスを制御するための新規手法を導入しており、標準的なアダム解析には存在しない。
  • 導出された収束速度は、マルコフ的サンプリング下での既存のバニラポリシー勾配法の結果を改善し、オーダー的により優れた計算複雑性を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。