Skip to main content
QUICK REVIEW

[論文レビュー] Importance mixing: Improving sample reuse in evolutionary policy search methods

Aloïs Pourchot, Nicolas Perrin|arXiv (Cornell University)|Aug 17, 2018
Reinforcement Learning in Robotics参考文献 23被引用数 11
ひとこと要約

本稿では、進化的方策探索におけるサンプル再利用を改善するための強化された重要度混合メカニズムを提案し、直近の世代だけでなく複数の過去の世代からのサンプルを再利用可能に拡張している。標準的な重要度混合はサンプル効率を顕著に向上させるが、拡張版では僅かな向上にとどまり、高い再利用率(約90%)であっても、進化的手法は深層強化学習に比べて依然としてはるかにサンプル効率が低い。一方で、スパarsely-rewardedな設定ではより安定している。

ABSTRACT

Deep neuroevolution, that is evolutionary policy search methods based on deep neural networks, have recently emerged as a competitor to deep reinforcement learning algorithms due to their better parallelization capabilities. However, these methods still suffer from a far worse sample efficiency. In this paper we investigate whether a mechanism known as "importance mixing" can significantly improve their sample efficiency. We provide a didactic presentation of importance mixing and we explain how it can be extended to reuse more samples. Then, from an empirical comparison based on a simple benchmark, we show that, though it actually provides better sample efficiency, it is still far from the sample efficiency of deep reinforcement learning, though it is more stable.

研究の動機と目的

  • 重要度混合が深層ニューロエボリューション手法におけるサンプル効率を顕著に改善できるかどうかを調査すること。
  • 元々の重要度混合メカニズムを拡張し、直前の1世代だけでなく複数の過去の世代からのサンプルを再利用できるようにすること。
  • 異なる進化的戦略において、拡張された重要度混合がサンプル効率に与える影響を実証的に評価すること。
  • 重要度混合を強化した進化的手法と、最先端の深層強化学習(例:DDPG)との間で、サンプル効率および安定性の観点から性能を比較すること。
  • サンプル効率のギャップが依然として存在する状況において、進化的手法と深層強化学習手法を組み合わせる可能性を検討すること。

提案手法

  • 本稿では、過去のポリシー生成から得たロールアウトを、現在のポリシー下での尤度に従って重み付けすることで、再利用する重要度混合の理解を容易にするための教育的フレームワークを導入している。
  • 本手法は、直近の1世代だけでなく、複数の過去の世代からのサンプルを再利用できるように拡張されており、新しい世代が完成するまで順次統合される。
  • 本手法は、現在のポリシーと過去のポリシー分布との乖離に基づいて、過去の世代からのサンプルに重要度重みを適用し、その寄与度を調整する。
  • 本手法は、連続的制御ベンチマーク(Continuous CartPoleおよびスパarsely-rewardedな変種であるContinuousCartPoleHard)で評価されており、SNES や Open-ES といったESの変種が使用されている。
  • サンプル再利用は再利用率(最大約90%)として定量化され、性能は時間ステップまたは評価回数ごとの平均報酬で測定されている。
  • 公平性を確保するため、同一のネットワークアーキテクチャとハイパーパramータを用いて、DDPG(最先端の深層強化学習アルゴリズム)と比較評価が行われている。

実験結果

リサーチクエスチョン

  • RQ1重要度混合は、進化的方策探索手法におけるサンプル効率を顕著に改善できるか?
  • RQ2直近の1世代だけでなく複数の過去の世代からのサンプルを再利用できるように重要度混合を拡張することで、直近1世代のみ再利用する場合に比べて顕著な改善が得られるか?
  • RQ3重要度混合を強化した進化的戦略のサンプル効率は、DDPGなどの深層強化学習アルゴリズムと比べてどの程度か?
  • RQ4重要度混合によるサンプル効率の向上は、収束速度のギャップを埋めるのに十分か?
  • RQ5特にスパarsely-rewardedな環境では、進化的手法が深層強化学習を上回るか、あるいはそれと同等の性能を発揮する環境はどのようなものか?

主な発見

  • 標準的な重要度混合は、進化的方策探索におけるサンプル効率を顕著に向上させ、収束に必要な評価回数を削減する。
  • 複数の過去の世代からのサンプルを再利用できるように拡張した重要度混合メカニズムは、標準的な重要度混合に比べて僅かな追加的利益しか得られていない。
  • 約90%のサンプル再利用率であっても、連続的CartPole環境(密集報酬)では、進化的手法(snes + EIM)はDDPGに比べて約10倍遅く収束している。
  • スパarsely-rewardedな環境(ContinuousCartPoleHard)では、DDPGは100万時間ステップを過ぎても進展を示さない一方、進化的手法は継続的に改善を示しており、このような環境における進化的手法の安定性と頑健性が浮き彫りになっている。
  • 高度なサンプル再利用を施しても、進化的手法と深層強化学習の間にはサンプル効率のギャップが依然として顕著に存在しており、サンプル効率が唯一のボトルネックではないことが示唆されている。
  • 結果から、今後の研究は、直接比較ではなく、進化的手法と深層強化学習を統合するハイブリッドフレームワークの開発に注力すべきであると考えられる。特に、重要度混合だけではこの効率のギャップを埋めきれないためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。