Skip to main content
QUICK REVIEW

[論文レビュー] Off-Policy Adversarial Inverse Reinforcement Learning

Samin Yeasar Arnob|arXiv (Cornell University)|May 3, 2020
Reinforcement Learning in Robotics参考文献 21被引用数 4
ひとこと要約

本稿では、ソフトアクターキャラクタ(SAC)と識別子ベースの敵対的フレームワークを組み合わせることで、サンプル効率と連続制御タスクにおける模倣性能を向上させる、オフポリシー敵対的逆強化学習(Off-Policy-AIRL)を提案する。この手法は、エキスパートのデモンストレーションがなくても、学習された報酬関数を用いた有効な転移学習を可能にし、最先端のAILアルゴリズムを上回る模倣性能を達成する。

ABSTRACT

Adversarial Imitation Learning (AIL) is a class of algorithms in Reinforcement learning (RL), which tries to imitate an expert without taking any reward from the environment and does not provide expert behavior directly to the policy training. Rather, an agent learns a policy distribution that minimizes the difference from expert behavior in an adversarial setting. Adversarial Inverse Reinforcement Learning (AIRL) leverages the idea of AIL, integrates a reward function approximation along with learning the policy, and shows the utility of IRL in the transfer learning setting. But the reward function approximator that enables transfer learning does not perform well in imitation tasks. We propose an Off-Policy Adversarial Inverse Reinforcement Learning (Off-policy-AIRL) algorithm which is sample efficient as well as gives good imitation performance compared to the state-of-the-art AIL algorithm in the continuous control tasks. For the same reward function approximator, we show the utility of learning our algorithm over AIL by using the learned reward function to retrain the policy over a task under significant variation where expert demonstrations are absent.

研究の動機と目的

  • 強力な転移学習能力を有するものの、模倣性能が低い既存の敵対的逆強化学習(AIRL)アルゴリズムの問題を解決する。
  • オフポリシー深層強化学習アルゴリズムを活用することで、連続制御タスクにおけるサンプル効率と模倣性能を向上させる。
  • エキスパートのデモンストレーションが利用できない転移学習シナリオにおいて、学習された報酬関数を用いたポリシー再訓練の有効性を示す。
  • ポリシー構造と報酬関数設計が模倣および転移学習性能に与える影響を調査する。
  • 乗法的コンポジショナルポリシー(MCP)が、転移学習中の柔軟性と性能向上に果たす役割を調査する。

提案手法

  • オフポリシー学習を可能にし、サンプル効率を向上させるために、生成器(ポリシー)としてソフトアクターキャラクタ(SAC)を採用する。
  • エキスパート軌道と生成軌道を区別する識別子ネットワークを統合し、敵対的訓練目的を形成する。
  • エントロピー正則化なしに状態に依存する報酬関数を学習し、提案フレームワークにおいて実証的に最良の性能を示す。
  • 模倣と転移学習の両方で同じ報酬関数近似器を使用することで、タスク間の一貫性を確保する。
  • 転移学習時にゲーティング関数のみを更新することで、柔軟なポリシー再訓練を可能にするために、乗法的コンポジショナルポリシー(MCP)を適用する。
  • 転移学習中にランダムな状態初期化を実装することで、探索性を向上させ、性能のばらつきを低減する。

実験結果

リサーチクエスチョン

  • RQ1SACのようなオフポリシー深層強化学習手法を用いることで、オンポリシーのベースラインと比較して、敵対的逆強化学習における模倣性能が向上するか?
  • RQ2模倣で良好に動作する報酬関数近似器が、エキスパートのデモンストレーションが欠如する状況でも、有効な転移学習を可能にするか?
  • RQ3乗法的コンポジショナルポリシー(MCP)は、完全な再トレーニングなしに、転移学習中のポリシーの柔軟性と性能を向上させることができるか?
  • RQ4転移学習中にランダムな状態初期化を実施することで、オフポリシー-AIRLにおける性能とばらつきにどのような影響を与えるか?
  • RQ5エージェントのダイナミクスが変更された場合に、この手法が一般化に失敗するのはなぜか?また、エージェントの構造的特性がこの失敗に与える影響は何か?

主な発見

  • SACを生成器として用いたOff-Policy-AIRLは、HalfCheetah-v2 や Ant-v2 などのMuJoCo連続制御環境において、最先端のAILアルゴリズムを上回る優れた模倣性能を達成する。
  • エントロピー正則化なしの単純な状態に依存する報酬ネットワークが、検証された報酬関数構成の中で最も優れた性能を示す。
  • 学習された報酬関数は、エキスパートのデモンストレーションが存在しない転移学習タスクにおいても、ポリシー再訓練を成功させることができ、模倣を超えた有用性を示す。
  • SAC-MCPは、標準的なSACと比較して模倣性能を向上させるとともに、特にゲーティング関数のみをファインチューニングする場合に性能のばらつきを低減する。
  • 転移学習中にランダムな状態初期化を実施することで、探索性が向上し、性能のばらつきが低減され、より安定かつ高い性能を持つポリシーが得られる。
  • エージェントのダイナミクスが変更された場合(例:Antでの麻痺した脚)、この手法は一般化に失敗する。これは、エージェントの構造的特性が転移可能性に顕著に影響を与えることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。