Skip to main content
QUICK REVIEW

[論文レビュー] Provably Efficient Imitation Learning from Observation Alone

Wen Sun, Anirudh Vemula|arXiv (Cornell University)|May 27, 2019
Reinforcement Learning in Robotics参考文献 46被引用数 20
ひとこと要約

本稿では、観測値のみを用いたアシストなしの模倣学習(ILfO)のためのモデルフリーなアルゴリズムであるFAIL(Forward Adversarial Imitation Learning)を提案する。FAILは、時間ステップ全体にわたる専門家と学習者の観測分布の間の統合確率距離(IPM)を最小化することで、観測空間のサイズに依存しないサンプル複雑性を達成し、サンプル複雑性が観測空間サイズに依存しないため、ピクセル入力などの高次元観測を持つ大規模なMDPに適している。

ABSTRACT

We study Imitation Learning (IL) from Observations alone (ILFO) in large-scale MDPs. While most IL algorithms rely on an expert to directly provide actions to the learner, in this setting the expert only supplies sequences of observations. We design a new model-free algorithm for ILFO, Forward Adversarial Imitation Learning (FAIL), which learns a sequence of time-dependent policies by minimizing an Integral Probability Metric between the observation distributions of the expert policy and the learner. FAIL is the first provably efficient algorithm in ILFO setting, which learns a near-optimal policy with a number of samples that is polynomial in all relevant parameters but independent of the number of unique observations. The resulting theory extends the domain of provably sample efficient learning algorithms beyond existing results, which typically only consider tabular reinforcement learning settings or settings that require access to a near-optimal reset distribution. We also investigate the extension of FAIL in a model-based setting. Finally we demonstrate the efficacy of FAIL on multiple OpenAI Gym control tasks.

研究の動機と目的

  • 専門家の行動や報酬にアクセスできない状況で、専門家の観測値のみが利用可能な模倣学習の課題に対処すること。
  • 高次元観測を持つ大規模MDPに対して、サンプル効率的かつ計算効率的なアルゴリズムを設計すること。
  • 関数クラスの複雑さにのみ依存するサンプル複雑性を保証することで、ILfOにおける証明可能なサンプル効率性を達成すること。
  • 表形式設定や近似的に最適なリセット分布を必要とする設定を超えて、証明可能な効率性を持つ模倣学習の適用分野を拡張すること。
  • 観測値のシーケンスのみを用いて、さまざまな制御タスクに一般化可能な実用的なアルゴリズムを開発すること。

提案手法

  • FAILは、各時間ステップでH個の独立した二人零和ゲームとしてILfOを定式化し、各ポリシーが次のステップでの専門家の観測分布に一致するように最適化する。
  • 学習者と専門家の観測分布の乖離を測る指標として統合確率距離(IPM)を用い、一連の識別器を介して分布マッチングを実現する。
  • 識別器は期待IPM値の差を最大化するように更新され、ポリシーはオンポリシー・サンプルを用いたポリシー勾配法により更新される、ミニマックス最適化フレームワークを採用する。
  • 主な革新点は、オフポリシー・データを必要とせず、効率的かつ安定した学習が可能なオンポリシー・サンプルを用いてポリシー勾配を推定することにある。
  • 本手法はモデルベース設定へ拡張され、さらにFAIL*(アルゴリズム5)が提案され、中間の軌道状態を再利用することでサンプル効率性が向上する。
  • 識別器の最大化ステップには線形計画法(LP)オラクルを活用し、ポリシー更新には確率的勾配降下法を用いることで、計算効率を確保する。

実験結果

リサーチクエスチョン

  • RQ1専門家の行動にアクセスできない状況で、観測値のみを用いて証明可能なサンプル効率性を持つ模倣学習アルゴリズムを設計できるか?
  • RQ2提案手法が関連パラメータの多項式関数としてのサンプル複雑性を達成し、ユニークな観測数に依存しないか?
  • RQ3本アルゴリズムは、生の画像などの高次元観測を持つ大規模MDPにおいて、効果的に一般化できるか?
  • RQ4オンポリシー・サンプルとIPMに基づく分布マッチングは、従来の手動で設計されたコスト関数や行動クラーニング手法と比較してどのように優れているか?
  • RQ5限定的なデモンストレーションデータ下での連続制御タスクにおけるアルゴリズムの実験的性能はいかがなものか?

主な発見

  • FAILは、サンプル複雑性がすべての関連パラメータの多項式関数であり、観測空間の濃度に依存しないILfO設定において、証明可能な効率性を達成する。
  • OpenAI Gymの制御タスクにおいて、専門家の行動が利用できないGAILや標準的な行動クラーニングと比較して、特にデータが少ない状況でも優れた実験的性能を示す。
  • 中間の軌道状態を再利用するFAIL*(アルゴリズム5)は、特に訓練データが限られている場合(例:0.25百万サンプル)に、より高いサンプル効率性を示す。
  • 専門家の行動、報酬関数、または近似的に最適なリセット分布を必要とせず、近似的に最適なポリシーを学習可能である。
  • Swimmer、Hopper、Reacherタスクにおける実験結果は、10個の異なる乱数シードにおいて一貫した性能向上を示しており、本手法の頑健性を裏付けている。
  • 理論的分析により、オラクル効率的な呼び出しを経由して計算効率性を維持し、観測空間サイズに指数関数的依存を回避していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。