Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robust Rewards with Adversarial Inverse Reinforcement Learning

Justin Fu, Katie Luo|arXiv (Cornell University)|Oct 30, 2017
Receptor Mechanisms and Signaling被引用数 80
ひとこと要約

AIRLは、学習される disentangled rewardsを備えたスケーラブルなIRL手法を提示し、未知またはシフトしたダイナミクスの下でポリシーを最適化できるようにし、転移タスクにおいて従来のIRLおよびGANベースの手法を上回りつつ、模倣ベンチマークと同等の性能を達成します。

ABSTRACT

Reinforcement learning provides a powerful and general framework for decision making and control, but its application in practice is often hindered by the need for extensive feature and reward engineering. Deep reinforcement learning methods can remove the need for explicit engineering of policy or value features, but still require a manually specified reward function. Inverse reinforcement learning holds the promise of automatic reward acquisition, but has proven exceptionally difficult to apply to large, high-dimensional problems with unknown dynamics. In this work, we propose adverserial inverse reinforcement learning (AIRL), a practical and scalable inverse reinforcement learning algorithm based on an adversarial reward learning formulation. We demonstrate that AIRL is able to recover reward functions that are robust to changes in dynamics, enabling us to learn policies even under significant variation in the environment seen during training. Our experiments show that AIRL greatly outperforms prior methods in these transfer settings.

研究の動機と目的

  • RLにおける報酬設計のボトルネックと自動報酬獲得の必要性を動機づける。
  • 変動するダイナミクスに跨って再利用可能な報酬を生み出す実用的なIRLアルゴリズムを開発する。
  • 報酬の形状付けと曖昧性に対処し、分離可能な報酬を学ぶ。
  • 未知のダイナミクスを伴う連続制御へのスケーラビリティと、学習した報酬の転送性を示す。

提案手法

  • 報酬と価値関数を同時に学習するために敵対的IRLフレームワークを採用する。
  • 状態-行動識別器を1つ使用し、f(s,a)を分離可能な報酬に結びつける: f(s,a,s') = g_theta(s,a) + gamma h_phi(s') - h_phi(s)。
  • 報酬成分 g_theta を状態のみに制約して、ダイナミクスからの分離を実現する。
  • 意図しない報酬設計の影響を緩和するために shaping term h_phi を組み込む。
  • 交互更新によって訓練する: expert と policy のサンプルを識別し、次に報酬モデルとポリシーを更新する。
  • 特定の設定において、学習された g_theta が定数分だけを除き真の報酬を回復するという理論的正当性を提供する。

実験結果

リサーチクエスチョン

  • RQ1AIRL は環境ダイナミクスの変化に頑健な分離可能な報酬を学習できるか。
  • RQ2AIRL は高次元の連続制御タスクに対してスケーラブルで効率的か。
  • RQ3異なるダイナミクスを持つ環境への転送を、従来のIRL手法と比較して分離可能な報酬の回収が改善するか。

主な発見

  • AIRL はダイナミクスの変化を跨いで転送できる分離可能な報酬を学習し、転送設定で素朴なIRL手法を上回る。
  • 表形式MDPでは、状態のみの報酬は定数分を除いて真の報酬を回復し、状態-行動報酬は整形された利得を生む。
  • 連続制御の転送タスクでは、状態のみの報酬を用いた AIRL が、ポリシーや非分離IRL手法がドメインシフト下で転送に失敗する場合に成功する。
  • AIRL は GAIL と標準的な模倣ベンチマークで同等を達成するが、転送・一般化シナリオでは GAIL を大幅に上回る。
  • GAN-GCL は高次元タスクで軌道中心の学習に苦戦する一方、AIRL はスケーラブルで効果的なまま。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。