Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Imitation via Variational Inverse Reinforcement Learning

Ahmed H. Qureshi, Byron Boots|arXiv (Cornell University)|Sep 17, 2018
Reinforcement Learning in Robotics参考文献 24被引用数 6
ひとこと要約

本論文は、変分情報最大化を用いたエナブリッシュメント正則化を組み込んだGANベースの敵対的逆強化学習(IRL)手法EAIRLを提案する。この手法は、状態-行動報酬関数とポリシーを同時に学習し、動的または構造的ドメインシフト下でもエキスパート水準の行動を実現する、強固で分離可能かつ転送可能な報酬を回復する。提案手法は、模倣学習および転移学習の両面で最先端のIRL手法を上回る性能を示す。

ABSTRACT

We consider a problem of learning the reward and policy from expert examples under unknown dynamics. Our proposed method builds on the framework of generative adversarial networks and introduces the empowerment-regularized maximum-entropy inverse reinforcement learning to learn near-optimal rewards and policies. Empowerment-based regularization prevents the policy from overfitting to expert demonstrations, which advantageously leads to more generalized behaviors that result in learning near-optimal rewards. Our method simultaneously learns empowerment through variational information maximization along with the reward and policy under the adversarial learning formulation. We evaluate our approach on various high-dimensional complex control tasks. We also test our learned rewards in challenging transfer learning problems where training and testing environments are made to be different from each other in terms of dynamics or structure. The results show that our proposed method not only learns near-optimal rewards and policies that are matching expert behavior but also performs significantly better than state-of-the-art inverse reinforcement learning algorithms.

研究の動機と目的

  • 既存の逆強化学習(IRL)手法が、転送可能で分離可能かつ行動依存の報酬関数を回復する点に限界を示しているのを是正すること。
  • 敵対的模倣学習における過学習および局所的収束問題を、ポリシー学習の正則化としてエナブリッシュメントを導入することで克服すること。
  • ロケーションや操作といった現実世界の制御タスクに不可欠な、近似的に最適な状態-行動ベースの報酬関数を回復できること。
  • 動的または構造的が異なる環境間で、学習済みポリシーおよび報酬の一般化と転送性を向上させること。
  • 敵対的学習と変分情報最大化を用いて、報酬、ポリシー、エナブリッシュメントを統合的に同時に学習するフレームワークの構築

提案手法

  • エキスパートの軌道と生成された軌道を区別するように訓練されたディスクライマーを備えた生成的敵対的模倣学習(GAIL)フレームワークを採用する。
  • ポリシー更新にエナブリッシュメント正則化を導入し、エージェントが将来の状態に影響を与える能力を最大化するよう促進することで、エキスパートのデモンストレーションへの過学習を防ぐ。
  • 変分情報最大化(VIM)を用いて、エナブリッシュメント、報酬、ポリシーをエンドツーエンド微分可能に同時に学習する。
  • 報酬関数を状態と行動(s,a)の関数としてモデル化することで、トルクペナルティを伴う制御タスクに不可欠な行動依存の報酬形状を可能にする。
  • 最大エントロピー逆強化学習(MaxEnt-IRL)の原則を適用し、ポリシー行動の確率的および多様性を保証する。
  • 重要度サンプリングとKLダイバージェンスの最小化を用いて、ポリシーが生成する軌道分布をエキスパートのデモンストレーションに一致させる。

実験結果

リサーチクエスチョン

  • RQ1エナブリッシュメント正則化は、敵対的模倣学習におけるエキスパートデモンストレーションから学習したポリシーの一般化性とロバスト性を向上させるか?
  • RQ2報酬関数を状態と行動(s,a)の両方の関数としてモデル化することで、状態のみの定式化と比較して、真の行動依存報酬構造の回復が向上するか?
  • RQ3提案手法は、異なる動的または構造的特性を持つ環境間で、転送可能で分離可能かつ近似的に最適な報酬関数を学習できるか?
  • RQ4GAIL や AIRL といった最先端のIRL手法と比較して、EAIRLはポリシー性能および報酬回復品質において優れているか?
  • RQ5エナブリッシュメント正則化は、ポリシー学習中に局所的行動への過早収束をどれほど防止できるか?

主な発見

  • HalfCheetah環境では、EAIRLが平均報酬1870.10 ± 17.86を達成し、GAIL(1880.05 ± 15.72)とAIRL(s,a)(1826.26 ± 19.64)を上回り、分散も小さい。
  • Ant環境では、EAIRLが641.12 ± 25.92の報酬を達成し、AIRL(s)(271.31 ± 9.35)とGCL(-189.90 ± 44.42)を著しく上回り、優れたポリシー学習を示している。
  • EAIRLは、真の報酬関数に含まれる行動依存ペナルティ項を正しく回復しているが、AIRL(s)はそのような項を学習できず、激しく不安定な行動を示している。
  • 転移学習において、EAIRLが学習した報酬は、動的または構造的が異なる環境へも一般化され、他の手法が失敗する状況でもエキスパート水準の性能を達成している。
  • 実験的結果から、状態のみの報酬定式化(例:AIRL(s))は、行動正則化が欠落しているため、歩行タスクで転倒するなど、劣悪なポリシー行動を引き起こすことが判明した。
  • エナブリッシュメント正則化と状態-行動報酬モデリングの組み合わせにより、多様な制御タスクにおいて近似的に最適なポリシーと強固で転送可能な報酬関数の回復が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。