Skip to main content
QUICK REVIEW

[論文レビュー] A Hybrid Stochastic Policy Gradient Algorithm for Reinforcement Learning

Nhan H. Pham, Lam M. Nguyen|arXiv (Cornell University)|Mar 1, 2020
Reinforcement Learning in Robotics参考文献 47被引用数 6
ひとこと要約

本稿では、不偏なREINFORCE推定器とバイアスのあるSARAHベースの推定器を組み合わせることで分散を低減しながら計算効率を維持する、新規なハイブリッド確率的方策勾配推定器を提案する。その結果得られるProxHSPGAアルゴリズムは、合成的方策最適化において1次停留点を求めるための最適な軌道複雑度𝒪(ε⁻³)を達成し、非合成的および合成的設定の両方で、REINFORCE (𝒪(ε⁻⁴)) や SVRPG (𝒪(ε⁻¹⁰ᐟ³)) といった既存手法を上回る性能を発揮する。

ABSTRACT

We propose a novel hybrid stochastic policy gradient estimator by combining an unbiased policy gradient estimator, the REINFORCE estimator, with another biased one, an adapted SARAH estimator for policy optimization. The hybrid policy gradient estimator is shown to be biased, but has variance reduced property. Using this estimator, we develop a new Proximal Hybrid Stochastic Policy Gradient Algorithm (ProxHSPGA) to solve a composite policy optimization problem that allows us to handle constraints or regularizers on the policy parameters. We first propose a single-looped algorithm then introduce a more practical restarting variant. We prove that both algorithms can achieve the best-known trajectory complexity $\mathcal{O}\left(\varepsilon^{-3} ight)$ to attain a first-order stationary point for the composite problem which is better than existing REINFORCE/GPOMDP $\mathcal{O}\left(\varepsilon^{-4} ight)$ and SVRPG $\mathcal{O}\left(\varepsilon^{-10/3} ight)$ in the non-composite setting. We evaluate the performance of our algorithm on several well-known examples in reinforcement learning. Numerical results show that our algorithm outperforms two existing methods on these examples. Moreover, the composite settings indeed have some advantages compared to the non-composite ones on certain problems.

研究の動機と目的

  • 強化学習における方策勾配法の高い分散、特に大規模または連続的アクション空間における問題を解決すること。
  • 不偏(REINFORCE)とバイアス(SARAH)の両推定器の長所を活かした分散低減型方策勾配推定器の開発。
  • 正則化や制約を含む合成的目的関数を扱えるプロキシマルアルゴリズムの設計。
  • 既存の方策勾配法と比較して、より優れたサンプル効率と収束速度を達成すること。
  • 連続的制御タスクにおける正則化子を含む合成的設定の優位性を実証的に検証すること。

提案手法

  • 不偏なREINFORCE(不偏)と変形したSARAH推定器(バイアスあり)を組み合わせることで、バイアスはあるが分散が低減された推定器を提案。
  • 正則化や制約を伴う合成的方策最適化に適した、シングルループ型プロキシマルハイブリッド確率的方策勾配アルゴリズム(ProxHSPGA)を構築。
  • 実用的収束性と安定性を向上させるために、ProxHSPGAのリスタート版を導入。
  • 合成的目的関数を扱うために、正則化子Q(θ)を用いたプロキシマルステップを導入し、安定性と収束性を保証。
  • ミニバッチとスナップショット戦略を用いて勾配の分散を低減。非i.i.d.サンプリング下での収束性について理論的分析を実施。
  • SVRGおよびSARAHにインspiredされた分散低減メカニズムを、軌道ベースのサンプリングに適応した方策勾配設定に応用。

実験結果

リサーチクエスチョン

  • RQ1不偏推定器とバイアス推定器を組み合わせたハイブリッド方策勾配推定器は、既存手法よりも優れた分散低減を達成できるか?
  • RQ2提案されたProxHSPGAアルゴリズムは、合成的方策最適化においてREINFORCE、GPOMDP、SVRPGよりも優れた軌道複雑度を達成できるか?
  • RQ3方策最適化問題に正則化子や制約を組み込むことで、連続的制御タスクにおけるサンプル効率と性能が向上するか?
  • RQ4リスタート版のProxHSPGAは、シングルループ版と比較して収束速度と安定性に優れているか?
  • RQ5異なる正則化子がMujoco環境における最終方策性能に与える影響は何か?

主な発見

  • ProxHSPGAアルゴリズムは、1次停留点に到達するための軌道複雑度𝒪(ε⁻³)を達成し、合成的方策最適化問題における最良の既知のレートを実現している。
  • ハイブリッド推定器はREINFORCEに比べて分散を低減しながらも計算効率を維持しており、実用的な収束を早めている。
  • 数値実験の結果、ProxHSPGAはCartPole、Acrobot、Mujoco環境を含む標準的な制御ベンチマークで、GPOMDPおよびSVRPGを常に上回る性能を示している。
  • 正則化子を含む合成的設定は、非合成的設定と比較して一貫して優れた性能を示しており、正則化がサンプル効率と方策の安定性を向上させることを示している。
  • ProxHSPGAのリスタート版は、特に高次元的・連続的制御タスクにおいて、実用的収束性が向上している。
  • 合計の軌道数とプロキシマル操作回数がともに𝒪(ε⁻³)であることを確認しており、理論的効率性とスケーラビリティを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。