Skip to main content
QUICK REVIEW

[論文レビュー] Expected Policy Gradients for Reinforcement Learning

Kamil Ciosek, Shimon Whiteson|arXiv (Cornell University)|Jan 10, 2018
Reinforcement Learning in Robotics参考文献 56被引用数 21
ひとこと要約

本論文は、行動の統合を勾配推定中に実行することにより、確率的および決定的方策勾配を統一的に一般化するExpected Policy Gradients (EPG)を導入する。EPGは決定的方策に依存せずに勾配の分散を低減し、連続的制御ベンチマークで最先端の性能を達成し、既存のアプローチを包含する一般化された方策勾配定理を提供する。

ABSTRACT

We propose expected policy gradients (EPG), which unify stochastic policy gradients (SPG) and deterministic policy gradients (DPG) for reinforcement learning. Inspired by expected sarsa, EPG integrates (or sums) across actions when estimating the gradient, instead of relying only on the action in the sampled trajectory. For continuous action spaces, we first derive a practical result for Gaussian policies and quadratic critics and then extend it to a universal analytical method, covering a broad class of actors and critics, including Gaussian, exponential families, and policies with bounded support. For Gaussian policies, we introduce an exploration method that uses covariance proportional to the matrix exponential of the scaled Hessian of the critic with respect to the actions. For discrete action spaces, we derive a variant of EPG based on softmax policies. We also establish a new general policy gradient theorem, of which the stochastic and deterministic policy gradient theorems are special cases. Furthermore, we prove that EPG reduces the variance of the gradient estimates without requiring deterministic policies and with little computational overhead. Finally, we provide an extensive experimental evaluation of EPG and show that it outperforms existing approaches on multiple challenging control domains.

研究の動機と目的

  • 確率的および決定的方策勾配手法を1つの一般化されたフレームワークで統一すること。
  • 決定的方策に依存せずに方策学習における勾配の分散を低減すること。
  • 多様な方策およびクライアントアーキテクチャに適用可能な一般化された解析的勾配推定手法を開発すること。
  • 新しい一般化された方策勾配定理に基づく理論的基盤を提供すること。
  • EPGの優位性を、挑戦的な制御環境において経験的に検証すること。

提案手法

  • EPGは、単一のサンプル行動に依存するのではなく、クライアントの行動に関する勾配を行動全体で統合することで、すべての行動における期待勾配を計算する。
  • ガウス方策および2次的クライアントの場合、EPGはクライアントのスケーリングされたヘッセ行列の行列指数を用いて閉形式の式を得る。
  • 解析的統合を介して、指数型分布族方策および有界サポートを持つ方策へと拡張可能である。
  • 独創的な探索戦略が導入され、共分散がクライアントのヘッセ行列の行列指数に比例するようになり、情報に基づいた探索を促進する。
  • 離散的行動の場合、EPGはソフトマックス方策と期待値統合を用いて適応される。
  • 一般化された方策勾配定理が導出され、SPGとDPGがEPGの特別なケースであることが示される。

実験結果

リサーチクエスチョン

  • RQ1確率的および決定的方策勾配を統合する1つの包括的フレームワークを開発できるか?
  • RQ2期待勾配推定が決定的方策を必要とせずに方策学習における分散を低減できるか?
  • RQ3解析的統合を多様なクラスの方策およびクライアントアーキテクチャにどのように適用できるか?
  • RQ4ヘッセ行列に基づく共分散スケーリングが探索および学習効率に与える影響は何か?
  • RQ5EPGは、挑戦的な連続的制御タスクにおいて、既存の方策勾配手法を上回るか?

主な発見

  • EPGは、確率的方策でさえも、標準的な方策勾配手法と比較して顕著に勾配の分散を低減する。
  • EPGは、MuJoCo環境を含む複数の連続的制御ベンチマークで最先端の性能を達成する。
  • ガウス方策の場合、ヘッセ行列に基づく探索戦略は収束を早め、より高いサンプル効率を実現する。
  • 理論的フレームワークにより、SPGとDPGが1つの一般化された方策勾配定理に統合される。
  • EPGは、多様な環境において一貫した改善を提供する一方で、計算オーバーヘッドは低く保たれる。
  • 経験的結果により、EPGがサンプル効率および最終的な性能の両面でベースライン手法を上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。