Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Variance Reduction for Policy Gradient Estimation

Tian-Bing Xu, Qiang Liu|arXiv (Cornell University)|Oct 17, 2017
Reinforcement Learning in Robotics参考文献 28被引用数 10
ひとこと要約

本稿では、TRPOの信頼領域フレームワークにSVRGによる分散低減を統合した確率的勾配分散低減方策であるSVRPOを提案する。この手法は、連続的制御タスクにおけるサンプル効率を顕著に向上させる。SVRPOは、Swimmer, Walker, Hopper, AntといったMujocoベンチマークでTRPOを上回る優れた性能を達成しており、勾配の分散低減と曲率情報の活用により実現される。

ABSTRACT

Recent advances in policy gradient methods and deep learning have demonstrated their applicability for complex reinforcement learning problems. However, the variance of the performance gradient estimates obtained from the simulation is often excessive, leading to poor sample efficiency. In this paper, we apply the stochastic variance reduced gradient descent (SVRG) to model-free policy gradient to significantly improve the sample-efficiency. The SVRG estimation is incorporated into a trust-region Newton conjugate gradient framework for the policy optimization. On several Mujoco tasks, our method achieves significantly better performance compared to the state-of-the-art model-free policy gradient methods in robotic continuous control such as trust region policy optimization (TRPO)

研究の動機と目的

  • モデルフリー強化学習における方策勾配推定の高分散がサンプル効率を妨げる問題に対処すること。
  • 方策更新における勾配分散を低減することで、信頼領域方策最適化(TRPO)の収束性と安定性を向上させること。
  • 確率的分散低減(SVRG)をTRPOフレームワークに統合し、連続的制御タスクにおける性能を向上させること。
  • 制御変数と曲率情報を利用したミニバッチ推定を活用して、ロールアウトのより効率的な利用を可能とすること。

提案手法

  • オンポリシー強化学習における方策勾配推定の分散低減に、SVRG技術を適用する。
  • フィッシャー情報行列を用いた曲率補正により、SVRGを信頼領域ニュートン-CG最適化フレームワークに統合する。
  • 推定された価値関数に基づく制御変数を用いて、方策更新における勾配分散をさらに低減する。
  • 軌道のミニバッチサンプリングを用いて、分散低減勾配を計算すると同時にオンポリシーの一貫性を維持する。
  • フィッシャー情報行列を活用して2次情報で方策更新をガイドすることで、収束の安定性を向上させる。
  • ステージストリックミニバッチ推定と信頼領域制約を組み合わせることで、探索と活用のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1確率的分散低減(SVRG)は、連続的制御における方策勾配法のサンプル効率を顕著に向上させることができるか?
  • RQ2SVRGと信頼領域最適化を組み合わせることで、Mujoco環境における収束速度と最終的パフォーマンスにどのような影響を与えるか?
  • RQ3制御変数と曲率情報による分散低減は、方策学習の安定性をどの程度向上させるか?
  • RQ4提案手法は、TRPOに匹敵する最新のオンポリシー手法に比べ、サンプル効率と最終リターンの面で優れているか?

主な発見

  • SVRPOは、Swimmer, Walker, Hopper, Antを含むMujocoタスクでTRPOよりも顕著に優れたパフォーマンスを達成する。
  • 勾配分散の低減により、バニラ方策勾配法やTRPOと比較して、より安定的かつ高速に収束する。
  • SwimmerとWalkerでは、修正のない勾配を用いたTRPOは高い分散のため改善が困難であるが、SVRPOは有効な方策を効果的に学習する。
  • SVRPOにおける制御変数とフィッシャー情報行列の活用により、より効率的な方策更新と高いサンプル効率が実現される。
  • 体系的な実験により、SVRPOはTRPOよりも少ない環境インタラクション回数でより高いリターンに到達することが示され、サンプル効率の向上が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。