Skip to main content
QUICK REVIEW

[論文レビュー] Sample-based Distributional Policy Gradient

Rahul Singh, Keuntaek Lee|arXiv (Cornell University)|Jan 8, 2020
Reinforcement Learning in Robotics参考文献 27被引用数 7
ひとこと要約

本稿では、再パラメータ化されたノイズサンプルを用いてリターン分布をモデル化する、新しいアクタ・クリティック強化学習アルゴリズムであるサンプルベースの分布的方策勾配(SDPG)を提案する。離散的なカテゴリカルまたは分位数表現とは異なり、再パラメータ化されたサンプルに基づくリターン分布推定と分位数Huber損失を用いることで、OpenAI Gymの複数の連続的制御環境において、D4PGよりも優れたサンプル効率と平均リターンを達成する。

ABSTRACT

Distributional reinforcement learning (DRL) is a recent reinforcement learning framework whose success has been supported by various empirical studies. It relies on the key idea of replacing the expected return with the return distribution, which captures the intrinsic randomness of the long term rewards. Most of the existing literature on DRL focuses on problems with discrete action space and value based methods. In this work, motivated by applications in robotics with continuous action space control settings, we propose sample-based distributional policy gradient (SDPG) algorithm. It models the return distribution using samples via a reparameterization technique widely used in generative modeling and inference. We compare SDPG with the state-of-art policy gradient method in DRL, distributed distributional deterministic policy gradients (D4PG), which has demonstrated state-of-art performance. We apply SDPG and D4PG to multiple OpenAI Gym environments and observe that our algorithm shows better sample efficiency as well as higher reward for most tasks.

研究の動機と目的

  • 連続的アクション空間設定における既存の分布的強化学習(DRL)手法の限界、特にD4PGのようなアルゴリズムにおけるサンプル非効率性と固定解像度の価値分布表現を解決すること。
  • 離散化やプロジェクションを回避するため、再パラメータ化を用いたサンプル化されたリターン分布を用いるDRLフレームワーク内での方策勾配法の開発。
  • リターンの境界に関する事前知識が不要な高解像度で柔軟なリターン分布モデリングを可能にすることで、連続的制御タスクにおけるサンプル効率と最終的パフォーマンスの向上。
  • 再パラメータ化によるサンプルベースのリターン分布学習が、離散的なカテゴリカル表現よりも優れた一般化性能と収束速度をもたらすことを実証すること。

提案手法

  • SDPGは再パラメータ化技術を用いて、単純なノイズ分布(例:ガウス分布)からリターン分布のサンプルを生成し、微分可能なサンプリングとエンドツーエンド学習を可能にする。
  • クリティックネットワークは、Wasserstein距離の代理として機能する分位数Huber損失の変種を用いて訓練される。
  • アルゴリズムはアクタ・クリティックフレームワークに従う:アクタネットワークは方策をパrameter化し、クリティカルネットワークはサンプル化されたリターンに分布的ベルマン方程式を適用することで、ターゲットリターン分布を近似する。
  • リターン分布はサンプルを通じて暗黙的に表現され、固定された離散化が不要なため、トレーニング後に任意の解像度で再構築可能である。
  • リターンの境界に関するドメイン知識の必要性がなく、D4PGで必要なプロジェクションステップが排除され、トレーニングの複雑さが低減される。
  • トレーニングは、クリティカルのサンプル化されたリターン分布と、分布的ベルマン更新から導かれたターゲット分布との間の分位数Huber損失を最小化することで行われる。

実験結果

リサーチクエスチョン

  • RQ1D4PGのような離散的カテゴリカル手法と比較して、連続的制御タスクにおけるDRLにおけるサンプルベースのリターン分布表現は、サンプル効率を向上させることができるか?
  • RQ2ノイズサンプルの再パラメータ化は、固定解像度のカテゴリカルまたは分位数表現と比較して、より表現力があり柔軟なリターン分布モデリングを可能にするか?
  • RQ3プロジェクションの欠如とリターン境界に関する事前知識の不在は、分布的RLにおける一般化性能とトレーニング安定性を向上させるか?
  • RQ4サンプル化されたリターンの数が、方策勾配アルゴリズムのパフォーマンスと収束速度にどのように影響するか?
  • RQ5提案手法は、最先端のDRL方策勾配ベースラインを上回る高い平均リターンと、より速い学習進捗を達成するか?

主な発見

  • SDPGは、評価されたすべての環境でD4PGよりも顕著に優れたサンプル効率を達成し、ターゲットリターン閾値に到達するためのエピソード数を大幅に削減した。
  • Pendulum-v1環境では、SDPGは平均で481エピソードでリターン閾値-150に到達したのに対し、D4PGは1605エピソードを要した。
  • Reacher-v2環境では、SDPGは-7のリターンに到達するのに11,859エピソードを要したが、D4PGは36,623エピソードを要した。
  • HalfCheetah-v2では、SDPGは1.0×10⁶ステップ後に平均リターン10,607 ± 845.04を達成したのに対し、D4PGは9,565.06 ± 209.77を記録した。
  • Humanoid-v2では、SDPGはわずかにパフォーマンスの遅れ(5,093.62 ± 402.25 対 6,064.14 ± 192.84)を示したが、トレンドは継続的な改善を示しており、より長いトレーニング時間でより高い最終的パフォーマンスを達成する可能性がある。
  • BipedalWalker-v2では、SDPGのクリティカルネットワークがターゲットリターン分布を適切に学習しており、生成された分布とターゲット分布のヒストグラムがほぼ完全に一致していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。