Skip to main content
QUICK REVIEW

[論文レビュー] Sample-efficient reinforcement learning using deep Gaussian processes

Charles W. L. Gadd, Markus Heinonen|arXiv (Cornell University)|Nov 2, 2020
Gaussian Processes and Bayesian Inference参考文献 25被引用数 4
ひとこと要約

本論文は、ガウス過程の不確実性評価とディープラーニングの表現能力を組み合わせることで、サンプル効率の高い強化学習のためのディープガウス過程(DGP)ベースのモデルを提案する。この手法により、複雑な制御タスクにおいて高速かつ安定した学習が可能となり、初期段階でのサンプル効率が優れており、半分チーター(half-cheetah)タスクでたった1回の相互作用エピソードで達成可能であり、先行するGPベースおよびニューラルネットワークベースのベースラインを上回る性能を示した。

ABSTRACT

Reinforcement learning provides a framework for learning to control which actions to take towards completing a task through trial-and-error. In many applications observing interactions is costly, necessitating sample-efficient learning. In model-based reinforcement learning efficiency is improved by learning to simulate the world dynamics. The challenge is that model inaccuracies rapidly accumulate over planned trajectories. We introduce deep Gaussian processes where the depth of the compositions introduces model complexity while incorporating prior knowledge on the dynamics brings smoothness and structure. Our approach is able to sample a Bayesian posterior over trajectories. We demonstrate highly improved early sample-efficiency over competing methods. This is shown across a number of continuous control tasks, including the half-cheetah whose contact dynamics have previously posed an insurmountable problem for earlier sample-efficient Gaussian process based models.

研究の動機と目的

  • サンプル非効率性の問題に取り組むこと、特に高コストな現実世界の環境において。
  • ガウス過程の不確実性認識モデリングとディープニューラルネットワークの表現力の両方を統合すること。
  • 最小限の相互作用データを用いて、非定常的かつ複雑な力学系において高速で信頼性の高い学習を可能にすること。
  • 半分チーターのような複雑なタスクで失敗する過去のGPベースのモデルの限界(モデル容量が不十分)を克服すること。
  • ベンチマークとしての連続制御環境において、改善されたサンプル効率と耐障害性を示すこと。

提案手法

  • 環境のダイナミクスをモデリングするためにディープガウス過程(DGPs)を用い、複数層のGP回帰器が階層的構成を形成する。
  • ベイズ推論を用いて軌道の事後分布を計算し、時間経過に伴う不確実性の伝播を可能にする。
  • 構造的カーネル設計を通じて、システムの滑らかさやダイナミクスに関する事前知識を組み込む。
  • 効率的な近似事後分布サンプリングを可能にする新規な推論スキームを導入し、モデルベース計画を支援する。
  • 深層構成を用いることでモデル容量を向上させつつ、原理的かつ整合性のある不確実性推定を維持する。
  • 報酬最適化のため、サンプルされた軌道を用いて行動選択にモデル予測制御(MPC)を統合する。

実験結果

リサーチクエスチョン

  • RQ1標準的なGPおよびニューラルネットワークベースのベースラインと比較して、ディープガウス過程はモデルベース強化学習におけるサンプル効率を向上させることができるか?
  • RQ2接触を伴う環境(例:半分チーター)における複雑で滑らかでないダイナミクスを、ディープGPモデルが効果的に捉えることができるか?
  • RQ3システムの滑らかさや構造に関する事前知識を組み込むことで、低データ環境における学習の安定性と性能が向上するか?
  • RQ4複数の連続制御ベンチマークにおいて、DGPベースの手法は初期学習速度と最終的性能の両面でどのように比較されるか?
  • RQ5先行するGPベースの手法とは異なり、たった1回のエピソードの相互作用でのみ強い性能を達成できるか?

主な発見

  • DGP-MPC手法は、競合する手法と比較して著しく高速な初期学習レートを達成し、半分チーター環境では最初のエピソードから正の報酬を蓄積した。
  • 半分チータータスクにおいて、GP-MMとGP-DSは報酬を蓄積できなかったが、PETSは顕著に多くの相互作用を要して同等の性能に到達した。
  • 最初の10エピソードにわたり、本手法は一貫性があり高い平均報酬を示し、学習速度と安定性の両面ですべてのベースラインを上回った。
  • 数エピソードのわずかな相互作用で強力な性能を達成したため、PETSや他のGPベースのモデルと比較して優れた初期サンプル効率を示した。
  • 複雑で非定常なダイナミクスにおいても、本手法は頑健な不確実性推定を維持し、最小限のデータからの信頼性のある計画を可能にした。
  • 10個の独立したランダムシードで安定した性能を示し、変動が小さく、一貫性のある学習行動を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。