Skip to main content
QUICK REVIEW

[論文レビュー] Energy-Based Imitation Learning

Minghuan Liu, Tairan He|arXiv (Cornell University)|Apr 20, 2020
Reinforcement Learning in Robotics参考文献 51被引用数 12
ひとこと要約

本稿では、スコアマッチングを用いてエキスパートのエネルギー関数を推定し、それをポリシー学習の代理報酬として用いる二段階フレームワーク、エネルギーベース型模倣学習(EBIL)を提案する。反復的報酬-ポリシー最適化を回避することで、計算コストが高く、訓練が不安定な従来の逆強化学習(IRL)およびGANベースの模倣学習手法に比して、性能は同等でありながら、訓練の安定性が向上し、解釈可能な報酬信号が得られる。

ABSTRACT

We tackle a common scenario in imitation learning (IL), where agents try to recover the optimal policy from expert demonstrations without further access to the expert or environment reward signals. Except the simple Behavior Cloning (BC) that adopts supervised learning followed by the problem of compounding error, previous solutions like inverse reinforcement learning (IRL) and recent generative adversarial methods involve a bi-level or alternating optimization for updating the reward function and the policy, suffering from high computational cost and training instability. Inspired by recent progress in energy-based model (EBM), in this paper, we propose a simplified IL framework named Energy-Based Imitation Learning (EBIL). Instead of updating the reward and policy iteratively, EBIL breaks out of the traditional IRL paradigm by a simple and flexible two-stage solution: first estimating the expert energy as the surrogate reward function through score matching, then utilizing such a reward for learning the policy by reinforcement learning algorithms. EBIL combines the idea of both EBM and occupancy measure matching, and via theoretic analysis we reveal that EBIL and Max-Entropy IRL (MaxEnt IRL) approaches are two sides of the same coin, and thus EBIL could be an alternative of adversarial IRL methods. Extensive experiments on qualitative and quantitative evaluations indicate that EBIL is able to recover meaningful and interpretative reward signals while achieving effective and comparable performance against existing algorithms on IL benchmarks.

研究の動機と目的

  • 従来の逆強化学習(IRL)およびGANベースの模倣学習手法に伴う高い計算コストと訓練の不安定性を解消すること。
  • 報酬推定とポリシー学習を分離することで、二段階的IRLおよび敵対的模倣学習の代替として簡素化され、反復的でない手法を開発すること。
  • 状態のみの模倣学習設定においても、エキスパートの行動から解釈可能な報酬信号を回復できること。
  • エネルギーベースモデリングが、敵対的IRLフレームワークに対する原理的かつ効果的な代替手段として機能しうることを示すこと。

提案手法

  • 尤度の明示的計算を避けるために、スコアマッチングを用いてエキスパートの占有測度をエネルギーベースモデル(EBM)で推定する。
  • 学習済みエネルギー関数から代理報酬関数を構築し、標準的な強化学習によりポリシー最適化を誘導する。
  • 連続制御タスクにおけるエキスパート軌道の非正規化密度をモデル化するために、ディープエネルギー推定ネットワーク(DEEN)を採用する。
  • 二段階の訓練プロセスを採用:まずエキスパートの行動データ上でエネルギーモデルを訓練し、次に推定された報酬を用いてポリシーをファインチューニングする。
  • サンプル効率を向上させるとともに、報酬のスパarsity問題を回避するために、エネルギー関数に単調な形状変換(例:シグモイド)を適用する。
  • ヒューリスティックなサンプルを用いてターゲット状態の周辺分布を一致させることで、状態のみの模倣学習への適用を実現する。

実験結果

リサーチクエスチョン

  • RQ1エキスパートのエネルギー推定から得られる固定で反復的でない報酬は、反復的IRLおよびGANベースの手法を上回る性能を発揮できるか?
  • RQ2提案手法のエネルギーベース報酬推定は、理論的に最大エントロピーIRLとどのように関係しているか?
  • RQ3最適でないか、スパースなデータであっても、EBILはエキスパートの行動データから意味的かつ解釈可能な報酬信号を回復できるか?
  • RQ4「半分訓練された」エネルギーモデルを用いることで、報酬のスパarsity問題を緩和し、ポリシー学習を改善できるか?
  • RQ5ヒューリスティックな状態分布の一致を用いることで、状態のみの模倣学習にEBILを拡張できるか?

主な発見

  • HopperやWalker2などの連続制御ベンチマークにおいて、EBILは最先端の敵対的IRL手法と同等の性能を達成し、訓練の安定性が向上している。
  • 推定されたエネルギー関数は、1次元および2次元環境での可視化により、エキスパート行動と整合する解釈可能な報酬信号を回復している。
  • アブレーションスタディの結果、完全に訓練されたモデルよりも「半分訓練された」モデルが滑らかでより効果的な報酬信号を提供することが多く、報酬のスパarsity問題が緩和されている。
  • ヒューリスティックな状態分布の一致を用いることで、EBILは状態のみの模倣学習を成功裏に実現し、行動のデモがなくても複雑な行動を学習可能である。
  • 理論的分析により、EBILとMaxEnt IRLは同一の問題の二面であり、MaxEnt IRLは交互最適化の下でEBILの特別な場合であることが示された。
  • 本手法は、最適でないエキスパートのデモに対しても頑健であり、複数の環境で高い性能を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。