Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Sample Analysis of Off-Policy Natural Actor-Critic Algorithm

Sajad Khodadadian, Zaiwei Chen|arXiv (Cornell University)|Feb 18, 2021
Reinforcement Learning in Robotics参考文献 71被引用数 7
ひとこと要約

本稿は、バイアスと分散を制御するための重要度サンプリングと、新たな$Q$-トレースアルゴリズムを用いた、オフポリシー自然アクタクリティック(NAC)アルゴリズムの有限標本収束解析を提案する。最小限の仮定のもとで、オフポリシーNACに対する既知の最初の標本複雑性バウンド$ olinebreak[4]\mathcal{O}(\epsilon^{-3}\log^2(1/\epsilon))$を確立し、既存のオンポリシーおよびオフポリシーのベースラインを上回る性能を示す。

ABSTRACT

In this paper, we provide finite-sample convergence guarantees for an off-policy variant of the natural actor-critic (NAC) algorithm based on Importance Sampling. In particular, we show that the algorithm converges to a global optimal policy with a sample complexity of $\mathcal{O}(ε^{-3}\log^2(1/ε))$ under an appropriate choice of stepsizes. In order to overcome the issue of large variance due to Importance Sampling, we propose the $Q$-trace algorithm for the critic, which is inspired by the V-trace algorithm \cite{espeholt2018impala}. This enables us to explicitly control the bias and variance, and characterize the trade-off between them. As an advantage of off-policy sampling, a major feature of our result is that we do not need any additional assumptions, beyond the ergodicity of the Markov chain induced by the behavior policy.

研究の動機と目的

  • オフポリシー自然アクタクリティック(NAC)アルゴリズムの有限標本収束保証を提供すること。
  • 重要度サンプリングに起因するオフポリシー学習における高い分散問題を、制御された切断機構を導入することで解決すること。
  • 単一の軌道データのみを用いても成立する、オフポリシーNACアルゴリズムに対する既知の最初の有限標本収束バウンドを確立すること。
  • オフポリシーNACがオンポリシーの対応手法よりも優れた理論的標本複雑性を達成できることを示すこと。
  • 行動方策の定常性の仮定のみを必要とし、追加の仮定なしにグローバル最適方策に収束することを示すこと。

提案手法

  • バイアスと分散を制御できる新しいオフポリシーTD学習アルゴリズム$Q$-トレースを提案。V-traceにインspiredされ、$Q$関数の推定に用いる。
  • 重要度サンプリング比の切断を用いて、オフポリシー更新における分散を制限し、バイアスと分散のトレードオフを明示的に特徴づける。
  • $Q$-トレースをNACフレームワークのコーチ部に統合し、安定なオフポリシー方策評価を可能にする。
  • アクター部では、フィッシャー情報行列による前処理を施した自然方策勾配更新を採用し、収束速度を向上させる。
  • 複数の独立したサンプルや追加の探索仮定を必要とせず、単一の軌道データを用いて収束を分析する。
  • 適切なステップサイズスケジュールのもとで、コーチとアクターの更新の収束速度を分析し、標本複雑性バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1最小限の仮定のもとで、オフポリシーNACアルゴリズムに対して有限標本収束保証を確立できるか?
  • RQ2切断された重要度サンプリングを用いることで、オフポリシー$Q$関数推定におけるバイアス・バリアンストレードオフをどのように制御できるか?
  • RQ3オフポリシーNACの最適な標本複雑性は、オンポリシーの対応手法と比べてどのように異なるか?
  • RQ4単一の軌道データのみを用いたオフポリシー学習は、追加の仮定なしにグローバル最適解に収束可能か?
  • RQ5切断レベルの選択が、オフポリシーNACアルゴリズムの収束行動と安定性にどのように影響するか?

主な発見

  • 提案されたオフポリシーNACアルゴリズムは、$\epsilon$-最適方策を求めるための標本複雑性$\mathcal{O}(\epsilon^{-3}\log^2(1/\epsilon))$を達成する。
  • $Q$-トレースアルゴリズムにより、重要度サンプリング比の切断を用いて、オフポリシー$Q$関数推定におけるバイアス・バリアンストレードオフを明示的に制御可能である。
  • 行動方策の定常性の仮定のみを満たせば、追加の条件なしにグローバル最適方策に収束することが保証される。
  • オフポリシーNACアルゴリズムの理論的標本複雑性は、既存のオンポリシーNACアルゴリズムの最良の既知のバウンド($\tilde{\mathcal{O}}(\epsilon^{-14})$および$\tilde{\mathcal{O}}(\epsilon^{-6})$)を上回る。
  • 実験結果から、切断レベル$\bar{\rho}$と$\bar{c}$の選択が収束速度と安定性に顕著な影響を及ぼすことが示され、$\bar{\rho}=3, \bar{c}=1$が最良の性能を示した。
  • コーチ部で繰り返しサンプルを使用すると収束しなくなることが判明し、安定な学習のためには各更新に対して独立したサンプルが必要であることが強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。