Skip to main content
QUICK REVIEW

[論文レビュー] Multi-task Maximum Entropy Inverse Reinforcement Learning

Adam Gleave, Oliver Habryka|arXiv (Cornell University)|May 22, 2018
Reinforcement Learning in Robotics参考文献 20被引用数 15
ひとこと要約

本稿では、複数のタスク間で共有される報酬構造を活用することで、サンプル効率を向上させる、正則化された最大因果エントロピー逆強化学習(MCE-IRL)フレームワークを提案する。グリッドワールドにおいて、単一タスクのMCE-IRLが数百件の示範が必要となるのに対し、本手法はワンショットの模倣学習を達成する。また、関数近似器へのメタラーニング拡張を検討し、多様な方策を持つ場合に悪化する敵対的IRLの限界を明らかにする。

ABSTRACT

Multi-task Inverse Reinforcement Learning (IRL) is the problem of inferring multiple reward functions from expert demonstrations. Prior work, built on Bayesian IRL, is unable to scale to complex environments due to computational constraints. This paper contributes a formulation of multi-task IRL in the more computationally efficient Maximum Causal Entropy (MCE) IRL framework. Experiments show our approach can perform one-shot imitation learning in a gridworld environment that single-task IRL algorithms need hundreds of demonstrations to solve. We outline preliminary work using meta-learning to extend our method to the function approximator setting of modern MCE IRL algorithms. Evaluating on multi-task variants of common simulated robotics benchmarks, we discover serious limitations of these IRL algorithms, and conclude with suggestions for further work.

研究の動機と目的

  • 類似したタスクから複数の報酬関数を推定するマルチタスク設定において、単一タスクの逆強化学習(IRL)のサンプル非効率性を解消すること。
  • 高次元で連続的な状態空間においてスケーラビリティに制限があるベイジアンIRLの課題を克服し、計算的に効率的な最大因果エントロピー(MCE)IRLフレームワークを採用すること。
  • タスク間の構造的類似性を活用する正則化されたMCE-IRL定式化により、複数の報酬関数を同時に推定することで、サンプル効率を向上させること。
  • メタラーニングを用いて関数近似器設定に拡張し、少数の示範で新しいタスクに一般化できるようにすること。
  • 敵対的IRLのマルチタスク連続制御ベンチマークにおける性能を調査し、多様な方策を持つ専門家方策に関連する根本的な限界を特定すること。

提案手法

  • タスク固有の報酬関数間の類似性を促進するため、損失関数に正則化項を追加することで、最大因果エントロピーIRLフレームワーク内にマルチタスクIRLを定式化する。
  • 報酬に線形関数近似を用いる:$ R(s,a) = \theta^T F(s,a) $、ここで$ \theta $は報酬重みベクトル、$ F(s,a) $は状態行動特徴量である。
  • 勾配ベースの最適化手法を用いて正則化されたMCE-IRL目的関数を最適化し、専門家の示範と整合する報酬関数を推定するとともに、タスク間での一般化を促進する。
  • 敵対的IRL(AIRL)にメタラーニングを適用し、報酬ネットワーク(判別器)のメタ初期化を学習することで、新しいタスクにおける少数のファインチューニングで効果的な方策が得られるようにする。
  • Reptileに基づくメタラーニングを用いて、タスク間で報酬ネットワークのパラメータを更新し、最小限の示範で新しい環境に素早く適応可能にする。
  • 離散グリッドワールドおよび連続制御ベンチマーク(例:MountainCarContinuous-v0)で評価を行い、固定および変動するゴール設定の両方で性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1正則化されたMCE-IRLは、単一タスクのMCE-IRLが数百件の示範を必要とするマルチタスク環境において、ワンショットの模倣学習を達成できるか?
  • RQ2単一タスクのAIRLと比較して、メタラーニングされた敵対的IRLは、単一モードと多様な方策を持つ専門家方策を有するマルチタスク連続制御環境で、どのように性能を発揮するか?
  • RQ3敵対的IRLには、特に専門家方策が多様な場合にどのような限界があるか?
  • RQ4メタラーニングは、関数近似器ベースのIRLフレームワークにおいて、新しいタスクへの一般化をどの程度向上させるか?
  • RQ5敵対的IRLが多様な環境で失敗するのは、GANにおけるモード崩壊と類似しており、最近のGANトレーニング技術(例:アンロールや変分学習)がIRLトレーニングの安定化に寄与できるか?

主な発見

  • 正則化されたMCE-IRL手法は、$9 \times 9$グリッドワールドでワンショットの模倣学習を達成し、1件の示範の後でほぼ最適な方策を回復する。一方、単一タスクのMCE-IRLは数百件の示範を必要とする。
  • MountainCarContinuous-v0の固定テストケースでは、単一タスクのAIRLとメタ-AIRLの両方がほぼ最適な性能を達成する。これは最適方策が単一モードであり、少数の軌道から容易に一般化可能であるためである。
  • 変動テストケース(ゴールフラッグの位置がランダムに変化し、専門家方策が二様である)では、単一タスクのAIRLですら100件の示範後でも良好な方策を学習できない。これは多様な行動を一般化できていないことを示している。
  • メタ-AIRLも変動テストケースで失敗する。これは、多様な専門家方策に対処できず、不安定な元の敵対的IRLアルゴリズムの欠陥に起因する。
  • 本研究では、敵対的IRLが多様な環境において根本的な限界に直面していることが特定された。これは、GANにおけるモード崩壊と類似しており、判別器が複数の最適行動モードを捉えきれていない可能性がある。
  • 著者らは、現在の敵対的IRL手法は多様な専門家方策を持つタスクには不適切であり、今後の研究ではGANトレーニングの進展(例:アンロールや変分学習)を模倣した改善されたトレーニングダイナミクスの検討が重要であると結論づける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。