Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Generative Modeling for Efficient Exploration

Neale Ratzlaff, Qinxun Bai|arXiv (Cornell University)|Nov 19, 2019
Reinforcement Learning in Robotics参考文献 43被引用数 4
ひとこと要約

本論文は、深層強化学習における環境ダイナミクスの事後分布を近似するために、アモアタイズド・スティン変分勾配降下(SVGD)を用いた新しい暗黙的生成モデル手法を提案する。生成器から複数のニューラルネットワークダイナミクスモデルをサンプリングすることで、予測分散を用いてベイジアンの不確実性を推定し、これにより効率的な探索を促進する内部報酬が得られる。本手法は、困難なスパース報酬環境において、データ効率性の面で最先端の手法を上回る性能を示した。

ABSTRACT

Efficient exploration remains a challenging problem in reinforcement learning, especially for those tasks where rewards from environments are sparse. A commonly used approach for exploring such environments is to introduce some "intrinsic" reward. In this work, we focus on model uncertainty estimation as an intrinsic reward for efficient exploration. In particular, we introduce an implicit generative modeling approach to estimate a Bayesian uncertainty of the agent's belief of the environment dynamics. Each random draw from our generative model is a neural network that instantiates the dynamic function, hence multiple draws would approximate the posterior, and the variance in the future prediction based on this posterior is used as an intrinsic reward for exploration. We design a training algorithm for our generative model based on the amortized Stein Variational Gradient Descent. In experiments, we compare our implementation with state-of-the-art intrinsic reward-based exploration approaches, including two recent approaches based on an ensemble of dynamic models. In challenging exploration tasks, our implicit generative model consistently outperforms competing approaches regarding data efficiency in exploration.

研究の動機と目的

  • 深層強化学習におけるサンプル非効率性、特にスパース報酬環境における課題に対処すること。
  • エージェントが環境ダイナミクスをどのように信じているかの不確実性をモデル化することで、探索の効率性を向上させること。
  • 制限的な分布仮定を必要としない、柔軟で非パラメトリックな事後分布近似を構築すること。
  • 既存の内部報酬ベースの探索手法よりも、データ効率性と探索カバレッジの両面で優れた性能を達成すること。
  • SACを用いたポリシー転送実験を通じて、本手法の転送可能性を評価すること。

提案手法

  • 生成器ネットワークを訓練し、アモアタイズド・スティン変分勾配降下(SVGD)を用いて、ダイナミクスモデルパラメータの事後分布を暗黙的に表現する。
  • 生成器からの各ランダムサンプルは、ダイナミクスモデルとして機能するニューラルネットワークを生成し、これにより複数のサンプルで事後分布を近似可能となる。
  • これらのサンプルされたダイナミクスモデル間の予測分散を、不確実な状態・行動領域での探索を促進する内部報酬信号として用いる。
  • パラメトリックな仮定やELBO近似を避けるために、暗黙の事後分布と真の事後分布の間のKLダイバージェンスを直接最小化する。
  • 一度の訓練フェーズで無制限のサンプリングが可能であるのに対し、アンサンブル手法とは異なり、各サンプルを得るために再訓練を必要としない。
  • 本手法は、純粋な探索設定および下流タスク設定の両方で評価され、SACを用いたポリシー転送実験も実施された。

実験結果

リサーチクエスチョン

  • RQ1アモアタイズドSVG Dを用いた暗黙的生成モデルは、アンサンブルベースの手法と比較して、ダイナミクスモデルの事後分布近似においてより柔軟で効率的であるか?
  • RQ2暗黙の事後分布から推定された不確実性は、既存の内部報酬手法と比較して、探索におけるデータ効率性を向上させるか?
  • RQ3本不確実性推定に基づく事前学習済み探索ポリシーは、密度の高い報酬環境における下流タスク学習を顕著に改善できるか?
  • RQ4純粋な探索フェーズの長さが、ポリシー転送設定における下流タスク性能に与える影響は何か?
  • RQ5本手法は、外部報酬がスパースな環境においても、頑健かつ有効に機能するか?

主な発見

  • 提案手法は、3つの困難な探索タスクにおいて、すべてのタスクで最先端の内部報酬ベースの探索手法をデータ効率性の観点から一貫して上回った。
  • ポリシー転送実験では、SACを本手法の探索ポリシーで初期化した場合、MAX や ICM、Disagreement などの手法を上回る性能を100万ステップの訓練で示した。
  • 純粋な探索にたった4,000ステップしか使用しなくても、SACベースラインを上回る下流タスク性能を達成しており、優れたサンプル効率性を示した。
  • ウォームアップあり・なしの両設定において、本手法はすべてのベースラインに対して明確な性能差を示し、その頑健性と転送可能性を確認した。
  • アブレーションスタディの結果、より長い純粋な探索フェーズが、下流タスク学習をさらに向上させることを確認した。探索時間の延長に伴い、性能は単調に向上した。
  • 結果から、アモアタイズドSVG Dによる暗黙の事後分布モデリングが、アンサンブルベースの不一致や不確実性測定と比較して、探索に向けたより効果的な不確実性推定を可能にすることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。