Skip to main content
QUICK REVIEW

[論文レビュー] ADAIL: Adaptive Adversarial Imitation Learning

Yiren Lu, Jonathan Tompson|arXiv (Cornell University)|Aug 23, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 5
ひとこと要約

ADAILは、学習済みのダイナミクス埋め込みに条件付け、ドメイン敵対的判別器を用いてダイナミクス不変性を強制することで、ダイナミクスが異なる環境間で一般化可能なポリシーを実現する、革新的な敵対的模倣学習フレームワークを提案する。本手法は、ソース環境でエキスパート水準のパフォーマンスを達成し、未学習のダイナミクスに対しても効果的に一般化し、GAILにダイナミクスのランダム化を適用した手法や教師付きベースラインを上回る性能を示した。MuJoCoベンチマークでは、たった10〜20件のエキスパートデモでの学習で実現した。

ABSTRACT

We present the ADaptive Adversarial Imitation Learning (ADAIL) algorithm for learning adaptive policies that can be transferred between environments of varying dynamics, by imitating a small number of demonstrations collected from a single source domain. This is an important problem in robotic learning because in real world scenarios 1) reward functions are hard to obtain, 2) learned policies from one domain are difficult to deploy in another due to varying source to target domain statistics, 3) collecting expert demonstrations in multiple environments where the dynamics are known and controlled is often infeasible. We address these constraints by building upon recent advances in adversarial imitation learning; we condition our policy on a learned dynamics embedding and we employ a domain-adversarial loss to learn a dynamics-invariant discriminator. The effectiveness of our method is demonstrated on simulated control tasks with varying environment dynamics and the learned adaptive agent outperforms several recent baselines.

研究の動機と目的

  • エキスパートの報酬関数が不明で、エキスパートデモが1つのソースドメインに限定されている状況において、ダイナミクスが異なる環境間で模倣ポリシーを転送する課題に対処すること。
  • トレーニング中に真の物理パラメータや報酬関数にアクセスできない状況でも、未知のダイナミクスに一般化可能なポリシーを実現すること。
  • 標準的なGAILがダイナミクスの変化に失敗する理由(判別器がダイナミクスの特徴に依存し、行動の質を評価しない)を克服すること。
  • 敵対的訓練を通じてダイナミクス不変の表現を学習し、頑健なポリシー一般化を実現する手法を開発すること。

提案手法

  • ポリシーを、教師ありまたは変分オートエンコーダ(VAE)法で学習したダイナミクス埋め込みに条件づけることで、新しいダイナミクスに適応可能にする。
  • 判別器に勾配反転層(GRL)を導入し、ダイナミクス固有の信号を無視させ、行動の類似性に注目させるように促進する。
  • ドメイン敵対的損失を用いて、環境のダイナミクスに依存せず、エキスパート軌道と模倣軌道を区別するように判別器を訓練する。
  • 判別器の出力を強化学習によるポリシー改善の報酬信号として用い、明示的な報酬形状なしに模倣を実現する。
  • ポリシーと判別器を敵対的ループでトレーニングする。この際、ポリシーは判別器をだませるように、判別器はダイナミクスに依存しないように学習する。
  • 連続的なダイナミクス変動(例:重力、摩擦)を伴うMuJoCo環境で、真のダイナミクス埋め込みと予測されたダイナミクス埋め込みの両方を用いて、手法を評価する。

実験結果

リサーチクエスチョン

  • RQ11つのソース環境で限られたエキスパートデモのみを用いて学習したポリシーが、顕著に異なるダイナミクスを持つ環境に一般化できるか?
  • RQ2ダイナミクス不変の判別器は、ダイナミクスの特徴に依存するのではなく、行動の質に注目するのをどれほど効果的に防げるか?
  • RQ3学習済みのダイナミクス埋め込みにポリシーを条件づけることで、未知のダイナミクスへのゼロショット一般化が向上するか?
  • RQ4教師あり埋め込みと比較して、VAEによる非教師ありダイナミクス埋め込みは、ポリシーの一般化性能と頑健性においてどの程度優れているか?
  • RQ5ADAILは、未知のダイナミックレジームにおいて、ダイナミクスのランダム化を適用したGAILや教師付きベースラインを上回る性能を示せるか?

主な発見

  • ADAILは、ソース環境(HalfCheetah: 4283.20 ± 1569.31)でエキスパート水準のパフォーマンスを達成し、未学習のダイナミクスに対しても効果的に一般化し、ダイナミクスのランダム化を適用したGAIL(3182.72 ± 1753.86)を上回った。
  • Ant環境では、ADAILの平均報酬は2119.90 ± 2534.03であり、GAIL-rand(1579.36 ± 2082.10)とPPOエキスパート(1972.06 ± 2630.20)を上回った。
  • ソース環境へのアクセスが不可能な「ブラックアウト領域」でも、ADAILは真のダイナミクスパラメータを用いて良好な一般化を示した。これは、ダイナミクス不変の判別器の頑健性を示している。
  • 非教師ありVAE-ADAILは、ラベル付きダイナミクスを必要とせず、強力なパフォーランスを達成した。これは、学習された潜在空間が意味的なダイナミクス情報を捉えていることを示している。
  • ブラックアウト領域では、ダイナミクス推定の事後分布の不確実性が上昇し、VAE-ADAILのパフォーマンスが低下した。これは、一般化に正確なダイナミクス埋め込みが不可欠であることを確認した。
  • ADAILは、トレーニング時にどちらの真のダイナミクスパラメータや報酬関数にもアクセスできないにもかかわらず、多くの未知のダイナミクスでUP-trueベースライン(真のダイナミクスと報酬を使用)と同等またはそれを上回るパフォーマンスを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。