Skip to main content
QUICK REVIEW

[論文レビュー] Integrating Behavior Cloning and Reinforcement Learning for Improved Performance in Dense and Sparse Reward Environments

Vinicius G. Goecks, Gregory M. Gremillion|arXiv (Cornell University)|Oct 9, 2019
Reinforcement Learning in Robotics参考文献 35被引用数 9
ひとこと要約

本論文は、行動乗法(BC)と1ステップQ学習を統合するための組み合わせ損失関数と、人間のデモンストレーションを用いたオフポリシー事前学習を備えた、アクタ・クリティック強化学習手法としてのCycle-of-Learning(CoL)フレームワークを提案する。この手法により、報酬が密集している場合および疎である場合の両方において、安定的かつ高性能な方策学習が可能となり、事前学習後の性能劣化を伴わず、最先端の手法を上回る学習速度、安定性、および最終的パフォーマンスを達成する。

ABSTRACT

This paper investigates how to efficiently transition and update policies, trained initially with demonstrations, using off-policy actor-critic reinforcement learning. It is well-known that techniques based on Learning from Demonstrations, for example behavior cloning, can lead to proficient policies given limited data. However, it is currently unclear how to efficiently update that policy using reinforcement learning as these approaches are inherently optimizing different objective functions. Previous works have used loss functions, which combine behavior cloning losses with reinforcement learning losses to enable this update. However, the components of these loss functions are often set anecdotally, and their individual contributions are not well understood. In this work, we propose the Cycle-of-Learning (CoL) framework that uses an actor-critic architecture with a loss function that combines behavior cloning and 1-step Q-learning losses with an off-policy pre-training step from human demonstrations. This enables transition from behavior cloning to reinforcement learning without performance degradation and improves reinforcement learning in terms of overall performance and training time. Additionally, we carefully study the composition of these combined losses and their impact on overall policy learning. We show that our approach outperforms state-of-the-art techniques for combining behavior cloning and reinforcement learning for both dense and sparse reward scenarios. Our results also suggest that directly including the behavior cloning loss on demonstration data helps to ensure stable learning and ground future policy updates.

研究の動機と目的

  • 報酬が密集している場合や疎である場合に、特に探索が高コストかつ危険な環境において、強化学習(RL)におけるサンプル非効率性と収束の遅さという課題に対処すること。
  • 性能劣化を伴わず、行動乗法(BC)からディープRLへの効率的な移行を可能にする方策学習の改善。
  • BCとRLの損失成分を組み合わせた影響が、方策の安定性およびパフォーマンスに与える影響の理解。
  • 限られた人間のデモンストレーションを活用して、初期段階での高い方策パフォーマンスを達成し、その後オフポリシーRLによるファインチューニングを実施する手法の開発。
  • 最小限の人的インタラクションで、安全かつ迅速かつ安定した方策改善を、実世界のロボットシステムで実現すること。

提案手法

  • CoLフレームワークは、エキスパートのデモンストレーションにおける行動乗法損失と、エージェントが生成した経験からの1ステップQ学習損失を統合した組み合わせ損失関数を用いるアクタ・クリティックアーキテクチャを採用する。
  • 固定された割合のエキスパート(デモンストレーション)とエージェント生成経路を保持するオフポリシーの経験リプレイを採用し、学習の安定性を高め、方策の崩壊を防止する。
  • 人間のデモンストレーションを用いた事前学習から開始し、その後RLファインチューニング段階で組み合わせ損失の共同最適化を実施する。
  • 優先順位付き経験リプレイ(PER)のバリエーションについても評価しており、エキスパートとエージェントのサンプルを時系列差分(TD)誤差に基づいて優先順位付けすることで、データ効率を向上させる。
  • アクターとクリティックの両方のための共有ニューラルネットワークを用いて、深層決定的方策勾配(DDPG)スタイルのアルゴリズムでエンドツーエンドに訓練する。
  • 損失関数は、エキスパート行動への忠実度を維持するとともに、エージェントが探索を実施し長期的リターンを最適化できるように設計されている。

実験結果

リサーチクエスチョン

  • RQ1行動乗法と強化学習を効果的に統合することで、報酬が密集している場合および疎である場合の両方において、サンプル効率性と学習安定性を向上させることは可能か?
  • RQ2経験リプレイバッファにおけるエキスパートとエージェント経験の相対的比率が、方策パフォーマンスと学習安定性に与える影響は何か?
  • RQ3行動乗法による事前学習に続いて、BCとRL損失の共同最適化が、それぞれを逐次的または独立して適用する場合と比較して、より優れたパフォーマンスをもたらすか?
  • RQ4経験リプレイにおいてエキスパートとエージェントのサンプルに固定比率を適用することは、可変的または不均衡な比率と比較して、方策収束性およびパフォーマンスにどのような影響を与えるか?
  • RQ5提案手法は、自律飛行マルチロータ機の着陸など、高リスクかつ確率的要因の強い環境でも、安定的かつ高性能な方策学習を達成できるか?

主な発見

  • CoLフレームワークは、LunarLanderContinuous-v2およびAirSimマルチロータ機環境における報酬が密集している・疎である両方の設定で、行動乗法(BC)、DDPG、DAPGといった最先端の手法を上回っている。
  • LunarLanderContinuous-v2の報酬が疎なバージョンでは、BCとDDPGは500万ステップの学習後も収束せず、一方CoLは安定的かつ高性能な方策を達成した。
  • DAPGはCoLよりも収束が遅く、事前学習後のパフォーマンスベースラインも低かったが、CoLは劣化を伴わず、初期のBC方策を維持・改善した。
  • アブレーションスタディの結果、経験リプレイバッファにおけるエキスパートとエージェントのサンプルの固定比率がパフォーマンスに不可欠であり、単にBCとRLを逐次的に適用するだけでは同様の向上効果が得られなかった。
  • TD誤差に基づくサンプリングを用いた優先順位付き経験リプレイ(PER)の使用により、特にAirSimのような高確率的環境において、学習効率がさらに向上した。
  • 行動乗法と1ステップQ学習を統合した組み合わせ損失関数により、安定した学習とエキスパート行動に基づいた方策更新が可能となり、深刻な忘却やパフォーマンスの崩壊を防止した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。