Skip to main content
QUICK REVIEW

[論文レビュー] Augmenting GAIL with BC for sample efficient imitation learning

Rohit Jena, Changliu Liu|arXiv (Cornell University)|Jan 21, 2020
Reinforcement Learning in Robotics参考文献 32被引用数 7
ひとこと要約

本稿では、行動乗法(BC)と生成的対抗的模倣学習(GAIL)を組み合わせる単純で安定した手法を提案し、サンプル効率の良い模倣学習を実現する。BCの高速収束性とGAILの分布一致性能を統合することで、GAILと比較して環境との相互作用を最大10倍まで削減しながら、低次元および高次元の制御タスクにおいて最適な性能を維持する。

ABSTRACT

Imitation learning is the problem of recovering an expert policy without access to a reward signal. Behavior cloning and GAIL are two widely used methods for performing imitation learning. Behavior cloning converges in a few iterations but doesn't achieve peak performance due to its inherent iid assumption about the state-action distribution. GAIL addresses the issue by accounting for the temporal dependencies when performing a state distribution matching between the agent and the expert. Although GAIL is sample efficient in the number of expert trajectories required, it is still not very sample efficient in terms of the environment interactions needed for convergence of the policy. Given the complementary benefits of both methods, we present a simple and elegant method to combine both methods to enable stable and sample efficient learning. Our algorithm is very simple to implement and integrates with different policy gradient algorithms. We demonstrate the effectiveness of the algorithm in low dimensional control tasks, gridworlds and in high dimensional image-based tasks.

研究の動機と目的

  • GAILの環境相互作用におけるサンプル非効率性を、専門家軌道の低サンプル要件にもかかわらず解消すること。
  • 状態-行動分布のi.i.d.仮定に基づくBCの累積誤差と一般化性能の低さを克服すること。
  • プレトレーニングに依存せずに、BCとGAILの長所を統合した包括的なオンポリシー模倣学習フレームワークを構築すること。
  • 低次元制御および高次元画像ベースの環境において、安定性と収束速度を向上させること。
  • GAILの目的関数にBCを正則化項として統合することで、標準的なプレトレーニング戦略を上回る高速かつ安定した学習が達成されることを示すこと。

提案手法

  • 行動乗法の損失とGAILの対抗的報酬信号を組み合わせたハイブリッド損失を導入する。
  • ポリシーは、即時のパフォーマンスを向上させるための教師付きBC損失と、長期的な分布一致のためのGAILの識別器ベース報酬信号を組み合わせた目的関数に基づき、ポリシー勾配法で訓練される。
  • 係数αはBCとGAILの成分間のトレードオフを制御し、α=1は純粋なBC、α=0は純粋なGAILに対応する。
  • 本手法はさまざまなポリシー勾配法と互換性があり、最小限の修正でオフポリシー設定へも拡張可能である。
  • GAILの識別器は、専門家の状態-行動ペアとエージェントが生成したペアを区別するように訓練され、ポリシー最適化の報酬信号を提供する。
  • 本手法はオフポリシーのリプレイバッファや恒久的データ保存を回避するため、安全が求められる、またはプライバシーが重要な応用に適している。

実験結果

リサーチクエスチョン

  • RQ1BCとGAILを組み合わせることで、最終的パフォーマンスを損なわせずに環境相互作用のサンプル効率を向上させることができるか?
  • RQ2BCの収束が速いにもかかわらず、なぜBCでプレトレーニングした後にGAILで微調整すると失敗するのか?
  • RQ3GAIL目的関数にBCを正則化項として統合することで、純粋なGAILやBCプレトレーニングよりも高速かつ安定した学習が達成されるか?
  • RQ4GAILが不安定であると知られている高次元画像ベースの環境では、本手法がどのように性能を発揮するか?
  • RQ5本手法は、低次元制御、グリッドワールド、連続的制御タスクを含む多様な環境において、性能向上を一貫して維持できるか?

主な発見

  • グリッドワールド環境では、全グリッドサイズ(8×8、10×10、12×12)において、本手法はGAILおよびBCを常に上回り、サンプル効率に一貫した改善を示した。
  • 12×12グリッドでは、スパarsな報酬を伴うREINFORCEは3000万ステップ経過後もGAILのパフォーマンスの約70%にとどまったが、本手法ははるかに早くGAILのパフォーマンスに達し、それを上回った。
  • カーレーシング環境では、本手法は平均スコア732.55 ± 45.73を達成し、GAIL(419.82 ± 198.61)およびBC+GAIL(594.86 ± 263.12)を上回り、専門家のスコア740.42 ± 86.36に近づいた。
  • 画像ベースのタスクにおいて、本手法はGAILと比較して環境相互作用を最大10倍まで削減し、著しく少ないロールアウト回数で専門家に近いパフォーマンスを達成した。
  • BCでプレトレーニングした後、GAILで微調整する戦略は完全に失敗し、スコアがゼロに崩壊した。これは、専門家デモンストレーションで初期化されたBCポリシーが、GAILによる微調整で効果的に最適化できないことを示している。
  • 本手法は、MuJoCo、グリッドワールド、画像ベースの制御タスクを含む複数のポリシー勾配法および環境において、安定性と一貫した改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。