Skip to main content
QUICK REVIEW

[論文レビュー] Learning a Prior over Intent via Meta-Inverse Reinforcement Learning

Kelvin Xu, Ellis Ratner|arXiv (Cornell University)|May 31, 2018
Reinforcement Learning in Robotics参考文献 55被引用数 8
ひとこと要約

本稿では、多様なタスクから報酬関数の事前分布を学習することで、少量のサンプルでも効率的な少データ報酬学習を可能にする、メタ逆強化学習(Meta-IRL)フレームワークを提案する。少数の示範データに対して勾配降下法を用いて初期報酬関数重みをメタ最適化することで、視覚ベースの制御タスクにおいて、標準的なIRLおよびメタラーニングベースラインを上回る高いデータ効率性と一般化性能を達成した。特に、示範データが限られる状況で顕著な優位性を示した。

ABSTRACT

A significant challenge for the practical application of reinforcement learning in the real world is the need to specify an oracle reward function that correctly defines a task. Inverse reinforcement learning (IRL) seeks to avoid this challenge by instead inferring a reward function from expert behavior. While appealing, it can be impractically expensive to collect datasets of demonstrations that cover the variation common in the real world (e.g. opening any type of door). Thus in practice, IRL must commonly be performed with only a limited set of demonstrations where it can be exceedingly difficult to unambiguously recover a reward function. In this work, we exploit the insight that demonstrations from other tasks can be used to constrain the set of possible reward functions by learning a "prior" that is specifically optimized for the ability to infer expressive reward functions from limited numbers of demonstrations. We demonstrate that our method can efficiently recover rewards from images for novel tasks and provide intuition as to how our approach is analogous to learning a prior.

研究の動機と目的

  • 現実世界の強化学習において、専門家の示範データが不足しており報酬設計が困難であるという課題に対処すること。
  • 関連するタスクから共通の報酬関数事前分布を学習することで、少データ逆強化学習の性能を向上させること。
  • 特に高次元の観測(例:画像)からなる状況において、少数の示範データでのみ新しいタスクに効果的に一般化できること。
  • 過去のタスクから得たメタ学習された帰納的バイアスを活用することで、訓練データが限られた状況におけるIRLにおける過学習を低減すること。
  • メタ学習された報酬関数初期化が、ランダム初期化や教師あり事前学習に比べて、より速くかつ正確に適応できることを示すこと。

提案手法

  • 本手法は、専門家の示範データを伴う多様なタスクのセットを用いてメタ学習フェーズを実施し、報酬関数のパrameterizationの初期化を学習する。
  • 深層ニューラルネットワークを用いた関数近似により、最大エントロピーIRLフレームワーク(MaxEnt-IRL)を採用して示範データから報酬関数を推定する。
  • メタ最適化の目的関数は、タスク間で真の報酬関数と学習された報酬関数の下での最適方策の期待値差分を最小化することを目的とする。
  • メタテスト段階では、事前学習済みの報酬関数を、新しいタスクに対して少数の示範データで勾配ステップを数回行い微調整する。
  • 本手法は、事前学習済み表現の標準的な微調整による負の転送を避けるために、高速適応を可能にする初期重みを明示的に最適化する。
  • 本手法は、2つのドメインで評価された:2次元ナビゲーション環境(SpriteWorld)と、1人称視点画像を有する3次元屋内ナビゲーション環境(SUNCG)

実験結果

リサーチクエスチョン

  • RQ1視覚ベースの制御タスクにおける少データ逆強化学習において、報酬関数のメタ学習された事前分布は性能向上をもたらすか?
  • RQ2少数データ環境下でのIRLにおいて、メタ最適化初期化はランダム初期化や教師あり事前学習に比べてどのように優れているか?
  • RQ31つのメタ学習済み報酬関数が、未観測のタスクや環境にどの程度一般化できるか?
  • RQ4少数の示範データしか利用できない状況で、本手法は標準的なIRLおよび他のメタラーニングベースラインを上回るか?
  • RQ5ドメインシフトやデータ不足のため事前学習に失敗した場合でも、本手法は正の転送を達成できるか?

主な発見

  • SpriteWorld環境では、MandRIL(Meta-IRL)が1〜5例の示範データでのみ、ベースラインと比べて顕著に低い値差分を達成し、より多くのデータ量でも学習から再始動した場合を上回った。
  • SUNCG環境では、5つの示範データでホールドアウトタスクで82.6%の成功率を達成した。これは、学習から再始動した場合の76.5%、最良のメタラーニングベースラインの73.3%を上回った。
  • MandRILは、分布外のスプライトや未観測の住宅レイアウトに対しても効果的に一般化し、微調整を最小限に抑えても頑健な適応を示した。
  • 平均勾配更新を用いた教師あり事前学習ベースラインは、負の転送を引き起こし、一般化性能が著しく劣った。
  • 1つの示範データでも、MandRILはPICKタスクで52.3%、NAVタスクで90.7%の成功率を達成し、他の手法を大きく上回った。
  • アブレーションスタディの結果、メタ学習による初期化(事前適応)が不可欠であることが示された。初期化がなければ、平均で20.7%の性能に低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。