[論文レビュー] Intrinsic Reward Driven Imitation Learning via Generative Model
この論文では、アタリゲームにおける1回のライフのデモから内的報酬を学習するための条件付き変分オートエンコーダ(VAE)を用いた、生成的内在報酬駆動型模倣学習(GIRIL)という新規手法を提案する。前向きな状態遷移と後向きな行動符号化をモデル化することで、生成モデルは自己教師付き探索を可能にし、エージェントが熟練者を上回る性能を達成する。最大でデモレーダーの報酬の5倍に達する。
Imitation learning in a high-dimensional environment is challenging. Most inverse reinforcement learning (IRL) methods fail to outperform the demonstrator in such a high-dimensional environment, e.g., Atari domain. To address this challenge, we propose a novel reward learning module to generate intrinsic reward signals via a generative model. Our generative method can perform better forward state transition and backward action encoding, which improves the module's dynamics modeling ability in the environment. Thus, our module provides the imitation agent both the intrinsic intention of the demonstrator and a better exploration ability, which is critical for the agent to outperform the demonstrator. Empirical results show that our method outperforms state-of-the-art IRL methods on multiple Atari games, even with one-life demonstration. Remarkably, our method achieves performance that is up to 5 times the performance of the demonstration.
研究の動機と目的
- 1回のライフのデモでのみ、高次元環境(アタリゲームなど)で熟練者水準の性能やそれ以上の性能を達成するという課題に対処すること。
- データ不足と報酬バイアスのため、従来の逆強化学習(IRL)や行動クローン(BC)がしばしばデモレーダーの性能に達しないという限界を克服すること。
- 生成モデルを用いて内在報酬の族を生成することで、低データ環境における効果的な探索とポリシー最適化を可能にすること。
- 条件付きVAEを用いて、前向きな状態遷移と後向きな行動符号化を同時に学習することで、動的モデルの精度を向上させること。
- 最小限のデモデータでも、最先端のIRLおよび好奇心ベースの手法に比べて優れた模倣性能を達成すること。
提案手法
- 前向きなダイナミクスを条件付きデコーダとして、後向きな行動符号化を条件付きエンコーダとしてモデル化する、条件付きVAEに基づく生成的内在報酬学習(GIRL)モジュールを提案する。
- VAEを用いて、現在の状態と行動から多様な将来の状態を生成し、また将来の状態から行動を再構成することで、動的モデルの精度を向上させる。
- 再構成誤差と遷移確率に基づいて、内在報酬の族を生成し、サンプリングに基づく自己教師付き探索を可能にする。
- Proximal Policy Optimization(PPO)を用いて、内在報酬関数上でポリシーを訓練し、累積報酬を最大化する。
- 式(6)で報酬を計算する前に、状態と予測状態を[-1, 1]に正規化する。
- 報酬学習モジュールを、学習率3e-4および標準的なPPOハイパーパrameter(γ=0.95のGAEとエントロピー係数0.0)で最適化する。
実験結果
リサーチクエスチョン
- RQ1生成モデルは、1回のライフのデモでのみ、熟練者を上回る性能を達成できる内在報酬信号を学習できるか?
- RQ2前向きな状態遷移と後向きな行動符号化を同時にモデル化することで、動的モデルの精度が向上し、結果としてより良い探索とポリシー学習が可能になるか?
- RQ3提案手法GIRILは、最先端のIRLおよび好奇心ベースの手法と比較して、模倣性能とデータ効率の点でどのように差をつけるか?
- RQ4VAEに基づく生成モデルを用いて生成された内在報酬は、自己教師付き探索を支え、アタリゲームで超人的な性能を達成できるか?
- RQ5条件付きVAEによる動的モデルの品質が、低データの模倣学習設定における最終ポリシー性能にどの程度影響を与えるか?
主な発見
- GIRILは、連続制御タスクおよびアタリゲームの両方で、最先端のIRL手法(GAILおよびVAIL)を上回り、評価されたすべての設定で最高の平均報酬を達成した。
- InvertedPendulumおよびInvertedDoublePendulumのタスクでは、それぞれ990.2および9,164.9の平均報酬を達成し、CDIL(979.7および7,114.7)およびGAIL(113.6および725.2)を上回った。
- アタリゲームでは、1回のライフのデモでのみ学習したにもかかわらず、熟練者の性能を最大で5倍に上回った。
- 全エピソードデモの数が増加するにつれて、GIRILは評価されたすべてのゲームとタスクで一貫して最高の性能を達成した。
- アブレーションスタディにより、前向きダイナミクスと後向き行動符号化の共同モデル化が、ベースラインと比較して顕著に性能向上をもたらすことが確認された。
- 本手法は、複数のランダムシードおよび多様な環境においても、頑健性とスケーラビリティを示し、優れた性能を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。