Skip to main content
QUICK REVIEW

[論文レビュー] Sample-Efficient Imitation Learning via Generative Adversarial Nets

Lionel Blondé, Alexandros Kalousis|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 53被引用数 21
ひとこと要約

本論文では、オフポリシーのアクタクリティック学習と敵対的に訓練されたアンサンブル報酬を組み合わせることで、GAIL よりも著しく高いサンプル効率を達成するモデルフリーな模倣学習手法 SAM(Sample-efficient Adversarial Imitation Learning)を提案する。過去の経験をオフポリシー更新により再利用し、決定論的方策勾配を活用することで、連続制御タスクにおいて安定したエキスパート水準のパフォーマンスを維持しながら、環境との相互作用回数を最大2桁削減する。

ABSTRACT

GAIL is a recent successful imitation learning architecture that exploits the adversarial training procedure introduced in GANs. Albeit successful at generating behaviours similar to those demonstrated to the agent, GAIL suffers from a high sample complexity in the number of interactions it has to carry out in the environment in order to achieve satisfactory performance. We dramatically shrink the amount of interactions with the environment necessary to learn well-behaved imitation policies, by up to several orders of magnitude. Our framework, operating in the model-free regime, exhibits a significant increase in sample-efficiency over previous methods by simultaneously a) learning a self-tuned adversarially-trained surrogate reward and b) leveraging an off-policy actor-critic architecture. We show that our approach is simple to implement and that the learned agents remain remarkably stable, as shown in our experiments that span a variety of continuous control tasks. Video visualisations available at: \url{https://youtu.be/-nCsqUJnRKU}.

研究の動機と目的

  • GAIL の高いサンプル複雑性に起因する収束に必要な過剰な環境相互作用を解消すること。
  • エキスパートのデモ数依存性を減らしながらも、模倣学習のサンプル効率を向上させること。
  • オフポリシー学習と勾配ベースの方策最適化を組み合わせることで、敵対的模倣学習の安定性を向上させること。
  • 環境相互作用が高コストまたは危険な現実世界の設定において、迅速な展開を可能にすること。
  • オフポリシーのアクタクリティック手法と GAN ベースの報酬学習をモデルフリーなフレームワークで効果的に統合できることを示すこと。

提案手法

  • SAM は、リプレイバッファから過去の遷移を再利用するオフポリシーのアクタクリティックアーキテクチャを採用し、新たな環境相互作用への依存度を低減する。
  • 生成的敵対的ネットワーク(GAN)フレームワークを用い、ディスクライマーがエキスパートのデモとエキスパートが生成した軌道を区別する。
  • 方策は決定論的方策勾配(DPG)更新を用いて訓練され、報酬関数の勾配情報を介してバックプロパゲーションが可能になる。
  • 自己調整型のアンサンブル報酬が敵対的に学習され、方策が報酬信号の勾配に基づいて最適化できるようにする。
  • 訓練の安定化と報酬スケールの変動への耐性を高めるために、方策およびクリティックネットワークにレイヤーノーマライゼーションと Pop-Art を適用する。
  • 公平な比較を確保するため、GAIL と同一のディスクライマー構造を採用し、複数の並列トレーニングインスタンスによる垂直スケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1オフポリシー学習は、模倣学習に必要な環境相互作用回数を著しく削減できるか?
  • RQ2敵対的報酬学習とオフポリシーのアクタクリティック学習を組み合わせることで、方策の安定性を損なわずサンプル効率を向上させられるか?
  • RQ3モデルフリーな模倣学習フレームワークにおいて、報酬関数の勾配情報が効果的に活用できるか?
  • RQ4多様な連続制御タスクにおいて、SAM と GAIL との間で漸近的パフォーマンスおよび収束速度に差が生じるか?
  • RQ5模倣学習において、過去の経験をどれだけ再利用できるかが、新たな環境相互作用の必要性をどれほど低減できるか?

主な発見

  • SAM は、GAIL よりもエキスパート水準のパフォーマンスに到達するための環境相互作用回数を最大2桁削減した。
  • Reacher や InverseDoublePendulum などの環境では、SAM は一貫して GAIL の漸近的パフォーマンスに匹敵または上回り、一部のケースで GAIL がエキスパートの報酬に到達しないことも確認された。
  • 敵対的学習とオフポリシー更新の両方を組み合わせても、安定した訓練が実現した。
  • SAM が時系列差分学習を用いることで、GAIL が完全なロールアウトを必要とするモンテカルロ的手法とは異なり、1回の更新あたり数個の遷移で効率的な方策評価が可能になった。
  • 限られたデモデータでも高いパフォーマンスを維持でき、さまざまなデータセットサイズに対して頑健であることが示された。
  • リプレイの使用によりウォールクロック時間のトレーニングが長くなったが、環境相互作用が高コストである現実世界の応用ではそのトレードオフが正当化される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。