Skip to main content
QUICK REVIEW

[論文レビュー] Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning

Yannick Schroecker, Charles L. Isbell|arXiv (Cornell University)|Feb 15, 2020
Reinforcement Learning in Robotics参考文献 37被引用数 7
ひとこと要約

本稿では、後向き経験からの価値密度推定に正規化フローを用いる、Universal Value Density Estimation (UVDE) という新規手法を紹介する。この手法により、バイアスのない、サンプル効率の高いゴール条件付き強化学習および模倣学習が可能となり、1つの示範軌道のみで、ロケーションベンチマークにおいて GAIL を上回る最先端の示範効率を達成する。

ABSTRACT

This work considers two distinct settings: imitation learning and goal-conditioned reinforcement learning. In either case, effective solutions require the agent to reliably reach a specified state (a goal), or set of states (a demonstration). Drawing a connection between probabilistic long-term dynamics and the desired value function, this work introduces an approach which utilizes recent advances in density estimation to effectively learn to reach a given state. As our first contribution, we use this approach for goal-conditioned reinforcement learning and show that it is both efficient and does not suffer from hindsight bias in stochastic domains. As our second contribution, we extend the approach to imitation learning and show that it achieves state-of-the art demonstration sample-efficiency on standard benchmark tasks.

研究の動機と目的

  • 確率的領域における行動の低確率性を過大評価する Hindsight Experience Replay (HER) の根本的なバイアスを是正すること。
  • 価値密度推定を用いて、効率的なゴール条件付き強化学習と模倣学習を統合するフレームワークを構築すること。
  • 敵対的報酬形状の依存を避けて、専門家の状態-行動分布に一致させることで、模倣学習のサンプル効率を向上させること。
  • 自己教師付きロールアウトを用いて、示範状態に条件付けたゴール条件付き Q 関数を活用することで、観測のみのデータからの学習を可能とすること。

提案手法

  • 本手法は、正規化フロー(特に RealNVP)を用いて、与えられた状態-行動ペアからゴールに到達する割合の割合(割合)を表す価値密度を推定する。
  • 後向きサンプル(状態-行動-達成ゴールの三つ組)を活用して密度推定器を学習させることで、長期的期待報酬のバイアスのない推定が可能になる。
  • 価値密度を標準的な時系列差分学習と組み合わせることで、低分散かつバイアスのない学習を保証するゴール条件付き Q 関数を更新する。
  • 模倣学習では、示範状態をゴールとしてサンプリングすることで、エージェントを専門家の状態分布に一致させるように訓練する。
  • 敵対的訓練を避けるために、示範データを識別器の訓練データとして直接使用せず、Q 関数の条件付けにのみ利用する。
  • 本手法はゴール条件付き RL および模倣学習の両方へ適用可能であり、高次元で確率的な環境におけるロバストネスの向上がアブレーションスタディで示された。

実験結果

リサーチクエスチョン

  • RQ1後向きサンプルを用いて、ゴール条件付き強化学習における後向きバイアスを解消する価値密度推定が可能か?
  • RQ2価値密度推定は、敵対的報酬形状に依存せずに、サンプル効率の高い模倣学習を可能にするか?
  • RQ3複雑な歩行タスクにおいて、本手法は GAIL と比較してどの程度の示範効率を示すか?
  • RQ4価値密度推定は、高次元制御環境における観測のみのデータからの有効な学習を可能にするか?
  • RQ5従来の HER が失敗率が高いために機能しないような、複雑で確率的な環境において、本手法は一般化可能か?

主な発見

  • VDI は、1つのサブサンプルされた示範軌道のみを用いて HalfCheetah-v2 で専門家水準の性能を達成し、同じ条件下で GAIL を上回った。
  • Humanoid-v2-NonExploitable では、VDI は1つの示範軌道で専門家を効果的に模倣できたが、GAIL の性能は示範データが少ないほど急激に低下した。
  • 本手法は、正規化フローを用いて後向きサンプルから直接価値密度を推定することで、スパース報酬環境においても後向きバイアスを回避し、ロバストである。
  • VDI は、識別器を必要とせず、自己教師付きロールアウトからゴール条件付き Q 関数を学習することで、GAIL よりも示範サンプル効率が優れている。
  • 本手法は、観測のみのデータからの有効な模倣学習を可能にし、HalfCheetah-v2 での実験で状態分布に一致させるだけで成功が達成された。
  • Humanoid-v2 では、示範行動をゴールとして含めることで、探索が著しく向上した。これは、状態-行動分布の一致が高次元設定における学習を強化することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。