Skip to main content
QUICK REVIEW

[論文レビュー] Reinforced Imitation in Heterogeneous Action Space

Konrad Żołna, Negar Rostamzadeh|arXiv (Cornell University)|Apr 6, 2019
Reinforcement Learning in Robotics参考文献 32被引用数 5
ひとこと要約

本稿では、専門家の行動が利用できない状況やエージェントの行動空間が専門家のものと異なる場合に、報酬が疎であり、専門家の行動ラベルが得られない状況でエージェントを訓練する手法として、観測からの強化型模倣学習(RILO)を提案する。模倣学習と環境報酬の動的バランスをとることで、エージェントは専門家の模倣を上回る性能を発揮し、特に異種の行動空間において、標準的な状態のみを用いた模倣学習よりもより効率的に学習する。

ABSTRACT

Imitation learning is an effective alternative approach to learn a policy when the reward function is sparse. In this paper, we consider a challenging setting where an agent and an expert use different actions from each other. We assume that the agent has access to a sparse reward function and state-only expert observations. We propose a method which gradually balances between the imitation learning cost and the reinforcement learning objective. In addition, this method adapts the agent's policy based on either mimicking expert behavior or maximizing sparse reward. We show, through navigation scenarios, that (i) an agent is able to efficiently leverage sparse rewards to outperform standard state-only imitation learning, (ii) it can learn a policy even when its actions are different from the expert, and (iii) the performance of the agent is not bounded by that of the expert, due to the optimized usage of sparse rewards.

研究の動機と目的

  • 専門家の行動ラベルが得られない状況やエージェントの行動空間が専門家のものと異なる場合の模倣学習の課題に対処すること。
  • 疎な報酬と専門家の状態観測のみが利用可能な環境において、効率的なポリシー学習を可能にすること。
  • エージェントが専門家の行動を模倣するのと環境報酬を最大化するのを動的に切り替えること。
  • エージェントの行動が専門家のものと同一でない場合でも、疎な報酬を最適に活用することで専門家を上回る性能を達成すること。

提案手法

  • 専門家の行動ラベルを必要とせず、状態観測のみで動作するGAILの拡張により、専門家の行動ラベルの必要性を排除する。
  • 時間経過に伴い、模倣損失と強化学習損失のバランスを自動的に調整する自己探索メカニズムを導入する。
  • 専門家の状態軌道とエージェントが生成した軌道を区別するための識別器を用い、状態観測のみに基づいて学習する。
  • CSD、SSD、ATD、RTGDといった複数の模倣報酬形式を導入し、異なる報酬形状戦略におけるロバストネスと性能を評価する。
  • 再帰的ポリシーを必要とする場合には、完全観測可能および部分観測可能なグリッドワールド、および3次元ピクセルベースの環境(ViZDoom)でエージェントを訓練する。
  • 訓練過程において模倣損失への依存度を段階的に低下させることで、エージェントが模倣から報酬最大化行動へと段階的に移行できるようにする。

実験結果

リサーチクエスチョン

  • RQ1専門家の行動ラベルが得られない状況で、専門家の状態観測のみが利用可能であり、かつ行動空間が異なる場合に、エージェントは専門家を上回るポリシーを学習できるか?
  • RQ2専門家の行動ラベルが欠落している状況下で、模倣学習と疎な環境報酬を効果的に統合する方法は何か?
  • RQ3模倣と強化学習の目的関数の動的バランスは、静的模倣や純粋な強化学習に比べてより優れた性能をもたらすか?
  • RQ4行動空間が異なる場合でも、疎な報酬を活用することでエージェントは専門家ポリシーを上回ることができるか?
  • RQ5本手法は、完全観測対比部分観測、ピクセルベースの環境といった異なる行動空間構成や環境設定に一般化できるか?

主な発見

  • 疎な環境報酬を活用することで、標準的な状態のみの模倣学習よりも高速な収束とより優れた最終的性能を達成した。
  • ViZDoom 3次元環境では、行動空間が著しく異なる場合、自己探索を行うエージェントが、自己探索を行わないエージェントと比較して、ゴールに到達するまでの平均ステップ数を最大50%まで削減した。
  • 専門家の行動空間と同一の行動空間(単一行動)を持つエージェントでは、自己探索によりステップ数が10%削減され、より能力の高いエージェント(複数行動)では20%の改善が得られた。
  • 行動空間が異なる場合に、自己探索を行うエージェントとそうでないエージェントとの性能差が最大となり、本手法が異種環境において特に有効であることが示された。
  • 膨大な専門家データが与えられた場合、状態のみの模倣学習でも自己探索の性能に匹敵する結果が得られたことから、自己探索は専門家データが限られる状況で特に効果的であることが確認された。
  • CSD、SSD、ATD、RTGDといった異なる模倣報酬形式に対しても本手法は一般化でき、特定の報酬形状戦略に依存せず、一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。