Skip to main content
QUICK REVIEW

[論文レビュー] f-IRL: Inverse Reinforcement Learning via State Marginal Matching

Tianwei Ni, Harshit Sikchi|arXiv (Cornell University)|Nov 9, 2020
Reinforcement Learning in Robotics参考文献 41被引用数 4
ひとこと要約

f-IRLは、代理の状態分布と専門家の状態分布の間の任意のf-発散を、解析的勾配計算を用いて最小化することで、定常的報酬関数を学習する新しい逆強化学習手法を提案する。この手法は、サンプル効率が優れており、MuJoCoベンチマークにおいて敵対的模倣学習手法を上回り、効果的な行動転送と高速な下流ポリシー学習を可能にする。

ABSTRACT

Imitation learning is well-suited for robotic tasks where it is difficult to directly program the behavior or specify a cost for optimal control. In this work, we propose a method for learning the reward function (and the corresponding policy) to match the expert state density. Our main result is the analytic gradient of any f-divergence between the agent and expert state distribution w.r.t. reward parameters. Based on the derived gradient, we present an algorithm, f-IRL, that recovers a stationary reward function from the expert density by gradient descent. We show that f-IRL can learn behaviors from a hand-designed target state density or implicitly through expert observations. Our method outperforms adversarial imitation learning methods in terms of sample efficiency and the required number of expert trajectories on IRL benchmarks. Moreover, we show that the recovered reward function can be used to quickly solve downstream tasks, and empirically demonstrate its utility on hard-to-explore tasks and for behavior transfer across changes in dynamics.

研究の動機と目的

  • 模倣学習において、専門家の状態分布から定常的報酬関数を学ぶ課題に対処すること。
  • 特に専門家の軌道が限られた状況下でも、逆強化学習におけるサンプル効率を向上させること。
  • 回復した報酬関数を用いて、ダイナミクスの変化にわたる行動転送を可能にすること。
  • 専門家のデモンストレーションまたは直接指定されたターゲット状態密度の両方から学習する統一フレームワークを提供すること。
  • 従来の敵対的模倣学習手法と比較して、ハイパーパrameterへの感受性を低減すること。

提案手法

  • 本手法は、報酬パラメータに関して、代理と専門家の状態分布の間の任意のf-発散の解析的勾配を導出する。
  • 逆強化学習を、軌道分布や状態-行動分布ではなく、状態周辺分布の間のf-発散に関する最適化問題として定式化する。
  • f-IRLは、f-発散を最小化するための勾配降下法を用い、報酬関数のエンドツーエンド学習を可能にする。
  • アプローチは、前向きf-発散と逆向きf-発散の両方をサポートしており、選択に応じてモード探索型またはモードカバー型の挙動を実現できる。
  • 正規化されていない密度指定を可能とし、好みのエンコードやターゲット密度の定義を簡素化する。
  • 本手法は、再利用可能な定常的報酬関数を回復するように設計されており、ポリシーを再びから学習可能にすることを可能にする。

実験結果

リサーチクエスチョン

  • RQ1f-発散の解析的勾配を用いて、専門家の状態分布から定常的報酬関数を学習できるか?
  • RQ2f-IRLは、GAIL や AIRL といった敵対的模倣学習手法と比較して、サンプル効率に優れているか?
  • RQ3回復した報酬関数は、到達困難で報酬がスパarsな環境における学習を加速できるか?
  • RQ4同じ報酬関数を、ロボットの形状変更などのダイナミクスの変化にわたって転送できるか?
  • RQ5f-IRLは、従来のIRL手法と比較して、より少ないハイパーパrameterチューニングを必要とするか?

主な発見

  • f-IRLは、MuJoCoベンチマークにおいて、環境との相互作用ステップ数および専門家の軌道数の両面で、GAIL、AIRL、MaxEntIRL よりも優れたサンプル効率を達成した。
  • 50本の専門家軌道を用いたAnt環境では、f-IRLは報酬145.5を達成し、AIRL(-29.9)とMaxEntIRL(130.3)を上回った。
  • 本手法は、障害を負ったAntエージェントにおいても歩行ポリシーを効果的に学習し、ダイナミクスの変化にわたる行動転送を実証した。
  • ポイントマス目標到達タスクでは、f-IRLが期待通りのモードカバー型(Forward KL)およびモード探索型(Reverse KL)挙動を示した。
  • f-IRLは、すべてのMuJoCoタスクで最小限のハイパーパrameterチューニングで実行されたが、f-MAX や AIRL のような感受性の高いベースラインとは対照的であった。
  • 回復した報酬関数は、報酬がスパarsなタスクにおけるポリシー学習を高速化し、下流のポリシー学習における実用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。