Skip to main content
QUICK REVIEW

[論文レビュー] PC-MLP: Model-based Reinforcement Learning with Policy Cover Guided Exploration

Yuda Song, W. Sun|arXiv (Cornell University)|Jul 15, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

PC-MLP は、ポリシー・カバーと計画オラクル効率的なアプローチを用いて、非線形力学系における効率的で証明可能にサンプル効率的な探索を可能にするモデルベース強化学習アルゴリズムである。この手法は、スパarsely-reward および dense-reward の制御タスクにおいて、HandEgg や AntMaze といった挑戦的な環境を含め、最先端の性能を達成しており、計算効率を維持するとともに、報酬フリー探索を可能にしている。

ABSTRACT

Model-based Reinforcement Learning (RL) is a popular learning paradigm due to its potential sample efficiency compared to model-free RL. However, existing empirical model-based RL approaches lack the ability to explore. This work studies a computationally and statistically efficient model-based algorithm for both Kernelized Nonlinear Regulators (KNR) and linear Markov Decision Processes (MDPs). For both models, our algorithm guarantees polynomial sample complexity and only uses access to a planning oracle. Experimentally, we first demonstrate the flexibility and efficacy of our algorithm on a set of exploration challenging control tasks where existing empirical model-based RL approaches completely fail. We then show that our approach retains excellent performance even in common dense reward control benchmarks that do not require heavy exploration. Finally, we demonstrate that our method can also perform reward-free exploration efficiently. Our code can be found at https://github.com/yudasong/PCMLP.

研究の動機と目的

  • 実験的モデルベース強化学習における戦略的探索の欠如に取り組み、特に報酬がスパarsely な環境や複雑な力学系において失敗する事例を解消すること。
  • カーネル化非線形レギュレータ(KNRs)および線形 MDP に対して、証明可能にサンプル効率的かつ計算効率的なアルゴリズムを開発すること。
  • 楽観的計画オラクルに依存せずに、効率的な探索を可能にし、市販の計画ツールとの統合を可能にすること。
  • 探索に課題を伴う環境や dense-reward 環境を含む多様な制御ベンチマークにおいて、強力な性能を示すこと。
  • ポリシー・カバーのカバレッジマップを活用して、報酬フリー探索を支援すること。

提案手法

  • アルゴリズムは、モデルの適合中に深刻な忘却を防ぐために、これまでに学習されたポリシーのアンサンブルであるポリシー・カバーを維持する。
  • ポリシー・カバーに属するポリシーが収集した軌道から、力学モデルを適合させるモデル学習部を用いる。
  • 線形バンディットアルゴリズム(Dani et al., 2008)にインspired された報酬ボーナススキームを採用し、連続的な状態空間および行動空間における探索を促進する。
  • 計算コストの高い楽観的計画オラクルを避けるために、標準的な計画オラクルのみに依存する。
  • 実用的なディープラーニングバージョンである Deep PC-MLP は、ダイナミクスモデリングに深層ニューラルネットワークを、報酬ボーナスにはランダム特徴量(例:RFF)を用いる。
  • TRPO や MPPI などの市販のプランナを統合可能であり、実世界の制御タスクにおける柔軟な展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1RKHS でモデル化される非線形系(KNRs)において、モデルベース強化学習アルゴリズムが証明可能にサンプル効率的かつ計算効率的であるか。
  • RQ2ポリシー・カバーと標準計画オラクルの使用が、従来の手法が失敗する報酬がスパarsely な環境における効果的探索を可能にするか。
  • RQ3特別な探索メカニズムを必要とせずに、dense-reward ベンチマークでも優れた性能を維持できるか。
  • RQ4PC-MLP が複雑な環境で効率的な報酬フリー探索をどの程度実現できるか。
  • RQ5既存のベースラインと比較して、壁時計時間およびサンプル効率の観点から、アルゴリズムのスケーリング特性はいかなるものか。

主な発見

  • PC-MLP は多項式的サンプル複雑性を達成し、計画オラクル効率的であるため、標準的な市販の計画ツールとの統合が可能である。
  • HandEgg 環境では、PC-MLP はランダム探索に依存する SLBO や MBPO よりも著しく高速に学習を達成しており、それらは進捗を示さない。
  • AntMaze 環境では、PC-MLP は報酬信号が存在しない状況でも、5つのポリシーからなるポリシー・カバーのみで迷路を効果的に探索した。
  • 実用的な Deep PC-MLP 実装は、PETS-GT や MBPO などのベースラインと同等の壁時計時間で実行され、探索ボーナス計算によるわずかなオーバーヘッドしか発生しない。
  • MountainCar や Acrobot などの dense-reward ベンチマークでは、TRPO や MPPI をプランナとして用いることで、PC-MLP は強力な性能を発揮した。
  • 長時間スパンのタスクにおいても、PC-MLP は安定した性能を維持しており、TRPO はポリシー更新における振動を低減することで MPPI よりも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。