Skip to main content
QUICK REVIEW

[論文レビュー] Imitation learning based on entropy-regularized forward and inverse reinforcement learning.

Eiji Uchibe, Kenji Doya|arXiv (Cornell University)|Aug 17, 2020
Reinforcement Learning in Robotics参考文献 48被引用数 5
ひとこと要約

本稿では、エントロピー正則化のもとで前方および逆方向強化学習を統合する、新たな模倣学習フレームワークであるエントロピー正則化模倣学習(ERIL)を提案する。逆方向KLダイバージェンスを二重の識別器を用いて最小化し、密度比のトリックを活用することで、ERILはサンプル効率の高い方策学習を達成し、MuJoCo環境において先行手法を上回り、人間のポールバランス行動を解釈可能な報酬関数で正確にモデル化した。

ABSTRACT

This paper proposes Entropy-Regularized Imitation Learning (ERIL), which is a combination of forward and inverse reinforcement learning under the framework of the entropy-regularized Markov decision process. ERIL minimizes the reverse Kullback-Leibler (KL) divergence between two probability distributions induced by a learner and an expert. Inverse reinforcement learning (RL) in ERIL evaluates the log-ratio between two distributions using the density ratio trick, which is widely used in generative adversarial networks. More specifically, the log-ratio is estimated by building two binary discriminators. The first discriminator is a state-only function, and it tries to distinguish the state generated by the forward RL step from the expert's state. The second discriminator is a function of current state, action, and transitioned state, and it distinguishes the generated experiences from the ones provided by the expert. Since the second discriminator has the same hyperparameters of the forward RL step, it can be used to control the discriminator's ability. The forward RL minimizes the reverse KL estimated by the inverse RL. We show that minimizing the reverse KL divergence is equivalent to finding an optimal policy under entropy regularization. Consequently, a new policy is derived from an algorithm that resembles Dynamic Policy Programming and Soft Actor-Critic. Our experimental results on MuJoCo-simulated environments show that ERIL is more sample-efficient than such previous methods. We further apply the method to human behaviors in performing a pole-balancing task and show that the estimated reward functions show how every subject achieves the goal.

研究の動機と目的

  • エントロピー正則化の下で前方および逆方向強化学習を統合する包括的な模倣学習フレームワークの構築を目的とする。
  • エキスパートと学習者の方策分布間の逆方向KLダイバージェンスを最小化することで、方策学習におけるサンプル効率を向上させることを目的とする。
  • 示された軌道から解釈可能な報酬関数を推定することで、制御タスクにおける人間の行動戦略をモデル化することを目的とする。
  • 二つの識別器を用い、共有されたハイパーパrameterを有する密度比のトリックにより、頑健な報酬関数推定を可能とすることを目的とする。
  • エントロピー正則化のもとで、動的方策プログラミングおよびソフトアクタクリティックに類似した新しい方策最適化アルゴリズムを導出することを目的とする。

提案手法

  • ERILはエントロピー正則化付きのマークフ・意思決定過程を用い、方策学習の安定化と探索の向上を図る。
  • 状態のみに依存する識別器を用いて、エキスパートの状態分布と学習者に由来する分布との間の逆方向KLダイバージェンスを最小化する。
  • 第二の識別器は、状態、行動、次状態に条件付けられており、密度比のトリックを用いてエキスパートの軌道と生成された軌道を区別する。
  • 二つの識別器は、状態および遷移分布の対数比を推定するために訓練され、逆方向RLによる報酬関数の回復を可能にする。
  • 前方RL部は、逆方向RLから得た逆方向KL推定値を用い、エントロピー正則化のもとで分布の乖離を最小化するように方策を最適化する。
  • その結果得られるアルゴリズムは、動的方策プログラミングおよびソフトアクタクリティックに類似した新しい方策更新則を導出するが、エントロピー正則化を組み込むことで、安定性とサンプル効率が向上する。

実験結果

リサーチクエスチョン

  • RQ1エントロピー正則化の下で前方および逆方向RLを統合することで、模倣学習におけるサンプル効率が向上するか?
  • RQ2共有されたハイパーパrameterを有する二重の識別器の使用は、方策および報酬関数学習にどのような影響を及えるか?
  • RQ3ERILは、制御タスクにおける人間の行動戦略を反映する報酬関数を正確に回復できるか?
  • RQ4RLフレームワークにおけるエントロピー正則化は、ベースライン手法と比較して、より安定的かつ汎用性の高い方策最適化を実現するか?
  • RQ5ERILは、複雑なMuJoCo環境において、既存の模倣学習手法をどの程度上回るか?

主な発見

  • ERILは、MuJoCoシミュレーション環境において、先行する模倣学習手法と比較して高いサンプル効率を達成しており、収束が速く、データ要件が低いことが実証された。
  • ポールバランスタスクにおける人間のデモンストレーションから推定された報酬関数は、明確な行動戦略を示しており、人間のパフォーマンスと整合的で解釈可能であることが確認された。
  • 二重識別器の構成により、エキスパートと学習者の分布間の対数比の正確な推定が可能となり、逆方向RLの性能が向上した。
  • エントロピー正則化のもとで逆方向KLダイバージェンスを最小化することで、安定的かつ効果的な方策最適化プロセスが実現され、ソフトアクタクリティックおよび動的方策プログラミングに類似した挙動を示した。
  • 本手法は、異なる制御タスクにわたって一般化でき、限定的なエキスパートデモンストレーションでも性能を維持した。
  • 二つの識別器間の共有されたハイパーパラメータは、報酬推定プロセスにおける訓練の安定性を高め、過学習を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。