Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Model-Free Reinforcement Learning Using Gaussian Process

Ying Fan, Letian Chen|arXiv (Cornell University)|Dec 11, 2018
Reinforcement Learning in Robotics参考文献 20被引用数 5
ひとこと要約

本稿では、連続的状態空間における効率的な探索を可能にするためにガウス過程上の事後分布サンプリングを用いるモデルフリー強化学習アルゴリズム、GPPSTDを提案する。多様な示範(最適でないものも含む)を統合することで、Q値推定の不確実性が低減され、ベースライン手法と比較して収束が速く、サンプル効率が向上する。

ABSTRACT

Efficient Reinforcement Learning usually takes advantage of demonstration or good exploration strategy. By applying posterior sampling in model-free RL under the hypothesis of GP, we propose Gaussian Process Posterior Sampling Reinforcement Learning(GPPSTD) algorithm in continuous state space, giving theoretical justifications and empirical results. We also provide theoretical and empirical results that various demonstration could lower expected uncertainty and benefit posterior sampling exploration. In this way, we combined the demonstration and exploration process together to achieve a more efficient reinforcement learning.

研究の動機と目的

  • 連続的状態空間において高いサンプル効率を達成するモデルフリー強化学習アルゴリズムの開発。
  • 最適な示範に加え、部分的に最適でないものや失敗した軌道を含む多様な人間の示範を探索プロセスに統合し、価値関数推定の不確実性を低減すること。
  • 示範を用いることで、ガウス過程ベースのQ値モデルにおける期待不確実性を低減する理論的裏付けを提供すること。
  • 実験的に、示範と事後分布サンプリング探索を組み合わせることで、より速い学習と低いレグレットが達成されることを示すこと。

提案手法

  • GPPSTDアルゴリズムは、Q関数の共同ガウス過程モデルに事後分布サンプリングを適用し、学習済み環境モデルを必要とせずに効率的な探索を可能にする。
  • 状態-行動ペアの類似度を表すために平方指数カーネルを用い、異なる行動に対して長さスケールをゼロに設定することで、行動間の独立性を強制する。
  • 示範を用いてGPモデルを事前学習することで、初期の事後分散が低減され、Q値推定における期待不確実性が低下する。
  • 理論的分析により、決定的環境下でGPPSTDは Õ(√(HT)) のベイズレグレットバインドを達成し、個々の状態について Õ(√(T/H)) のベイズ推定誤差バインドを達成することが示された。
  • GP事後分布からのサンプリングを活用し、最も高いサンプルQ値を持つ行動を選択することで、探索と活用のバランスを図る。
  • GPとBNNは特定の条件下で密接に関連しているため、このフレームワークは理論的にベイジアンニューラルネットワークへの拡張が可能である。

実験結果

リサーチクエスチョン

  • RQ1ガウス過程モデル上の事後分布サンプリングは、連続的状態空間におけるモデルフリー強化学習において、理論的根拠に基づいた効率的探索を可能にするか?
  • RQ2最適な示範を超えて、多様な示範(部分的に最適でないものや失敗した軌道を含む)は、Q値推定の不確実性をどのように低減し、学習効率を向上させるか?
  • RQ3示範と事後分布サンプリングを組み合わせることで、標準的な探索戦略と比較して、実際の学習でより低いレグレットとより速い収束が達成されるか?
  • RQ4示範による期待不確実性の低減という理論的利点が、標準的な制御ベンチマークで実証的に確認できるか?
  • RQ5GPベースのフレームワークは、強化学習におけるベイジアンニューラルネットワークへどの程度一般化可能か?

主な発見

  • GPPSTDは、CartPole環境においてε-グリーディとDeep Q-Networksにε-グリーディを適用した場合と比較して、顕著に優れたサンプル効率と頑健性を示した。
  • 最適な示範に加え、部分的に最適でないものや失敗した軌道を含む多様な示範を用いることで、初期の事後分散(行動の不確実性)が、最適な示範のみを用いた場合よりも低減された。
  • 5つの最適なエピソードと5つの部分的に最適なエピソードを用いた「多様な事前学習」設定が、最も低いレグレットと最高のパフォーマンスを達成し、最適な示範のみの事前学習や事前学習なしの設定を上回った。
  • 最適な示範のみの事前学習では、推定の分散が高く、パフォーマンスに変動が生じた。これは、多様な示範が不確実性をより効果的に低減することを確認するものである。
  • 理論的分析により、示範がGPモデルの期待不確実性を低減することが確認され、その結果、事後分布サンプリングに基づく探索の効率が向上することが示された。
  • 実験的結果により、GPベースのモデルが、特に示範データを組み合わせた場合、深層ニューラルネットワークを上回るサンプル効率を達成できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。