Skip to main content
QUICK REVIEW

[論文レビュー] PC-PG: Policy Cover Directed Exploration for Provable Policy Gradient Learning

Alekh Agarwal, Mikael Henaff|arXiv (Cornell University)|Jul 16, 2020
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

PC-PG は、ポリシーの集合(ポリシー・カバー)を用いて探索と活用のバランスをとる、証明可能な効率性を持つ方策勾配法を導入している。この手法は、表形式および線形 MDP において、多項式時間のサンプル複雑度と実行時間複雑度を保証する。モデルの不適合に対しても強力な保証を提供し、平均誤差と分布シフト下での近似バウンドを含む。

ABSTRACT

Direct policy gradient methods for reinforcement learning are a successful approach for a variety of reasons: they are model free, they directly optimize the performance metric of interest, and they allow for richly parameterized policies. Their primary drawback is that, by being local in nature, they fail to adequately explore the environment. In contrast, while model-based approaches and Q-learning directly handle exploration through the use of optimism, their ability to handle model misspecification and function approximation is far less evident. This work introduces the the Policy Cover-Policy Gradient (PC-PG) algorithm, which provably balances the exploration vs. exploitation tradeoff using an ensemble of learned policies (the policy cover). PC-PG enjoys polynomial sample complexity and run time for both tabular MDPs and, more generally, linear MDPs in an infinite dimensional RKHS. Furthermore, PC-PG also has strong guarantees under model misspecification that go beyond the standard worst case `∞ assumptions; this includes approximation guarantees for state aggregation under an average case error assumption, along with guarantees under a more general assumption where the approximation error under distribution shift is controlled. We complement the theory with empirical evaluation across a variety of domains in both reward-free and reward-driven settings.

研究の動機と目的

  • モデルフリーの方策勾配法における探索と活用のトレードオフを解消すること。これらの手法は局所最適化に陥りやすく、効果的な探索が困難である。
  • 表形式および線形 MDP において、証明可能なサンプル効率性と実行時間複雑度を保証する手法を開発すること。
  • 特に関数近似と状態アグリゲーションを想定した状況において、モデル不適合に対するロバストネスの保証を提供すること。
  • 最悪ケースの仮定を超えて、平均ケースおよび分布シフトの設定においても理論的保証を拡張すること。

提案手法

  • PC-PG は、学習済みポリシーのアンサンブル(ポリシー・カバー)を構築し、単一のポリシーに比べて状態行動空間をより効果的に探索する。
  • ポリシー・アンサンブルのカバレッジに従って誘導される方策勾配更新を用いることで、未探索または低カバレッジ領域が積極的にターゲット化されるようにする。
  • 再生成核ヒルバート空間(RKHS)内で動作させることで、無限次元関数空間における一般化を可能にする。
  • ポリシー・カバーを通じて不確実性に対する楽観的アプローチを組み込み、低カバレッジ領域での探索を促進する。
  • 関連する問題次元に対して多項式的にスケーリングするサンプル複雑度と実行時間の理論的バウンドを提供する。
  • 平均誤差仮定下での近似保証と、分布シフト下での制御された誤差を導出する。

実験結果

リサーチクエスチョン

  • RQ1表形式および線形 MDP において、探索と活用のバランスを保ちつつ、証明可能なサンプル効率性と実行時間複雑度を達成できる方策勾配法は存在するか?
  • RQ2関数近似の下で、方策勾配法はモデル不適合に対してどのようにロバストにできるか?
  • RQ3近似誤差が平均誤差または分布シフト条件下で有界であると仮定した場合、どのような理論的保証を提供できるか?
  • RQ4ボーナス関数を明示的に使用せずに、ポリシー・カバー機構が未探索領域への探索を体系的かつ的確に誘導できるか?
  • RQ5報酬フリーおよび報酬駆動の両設定において、PC-PG の性能は、標準的な方策勾配法や Q-学習法と比較してどのように異なるか?

主な発見

  • PC-PG は、無限次元の RKHS 内で、表形式 MDP および線形 MDP において多項式的サンプル複雑度と実行時間複雑度を達成する。
  • モデル不適合下でも強力な保証を提供し、平均誤差仮定下での状態アグリゲーションの近似バウンドを含む。
  • 分布シフト下での近似誤差が有界である場合にロバストネスを保証し、標準的な最悪ケース ∞ 仮定を超える。
  • 実験的評価により、報酬フリーおよび報酬駆動の両設定において、多様な環境で競争力のある性能を示した。
  • ポリシー・カバー機構は、ヒューリスティックなボーナス関数や明示的な探索戦略に依存することなく、効果的に探索を誘導した。
  • 真のダイナミクスや価値関数が関数近似器によって完全に捉えられていない場合でも、理論的保証を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。