Skip to main content
QUICK REVIEW

[論文レビュー] Task-Agnostic Online Reinforcement Learning with an Infinite Mixture of Gaussian Processes

Mengdi Xu, Wenhao Ding|arXiv (Cornell University)|Jun 19, 2020
Gaussian Processes and Bayesian Inference被引用数 17
ひとこと要約

本論文は、事前学習を必要とせず、未知のダイナミクスに素早く適応できる、タスクに依存しないオンラインモデルベース強化学習手法を提案する。無限混合ガウス過程(GPs)を用いて非定常環境をモデリングし、逐次的変分推論と時間的遷移事前分布を用いることで、タスクの変化を検出し、過去のモデルを再利用し、不確実性を伴うダイナミクス表現を維持する。本手法は、動的制御およびドライブシナリオにおいて、ベースラインを上回る性能を発揮する。

ABSTRACT

Continuously learning to solve unseen tasks with limited experience has been extensively pursued in meta-learning and continual learning, but with restricted assumptions such as accessible task distributions, independently and identically distributed tasks, and clear task delineations. However, real-world physical tasks frequently violate these assumptions, resulting in performance degradation. This paper proposes a continual online model-based reinforcement learning approach that does not require pre-training to solve task-agnostic problems with unknown task boundaries. We maintain a mixture of experts to handle nonstationarity, and represent each different type of dynamics with a Gaussian Process to efficiently leverage collected data and expressively model uncertainty. We propose a transition prior to account for the temporal dependencies in streaming data and update the mixture online via sequential variational inference. Our approach reliably handles the task distribution shift by generating new models for never-before-seen dynamics and reusing old models for previously seen dynamics. In experiments, our approach outperforms alternative methods in non-stationary tasks, including classic control with changing dynamics and decision making in different driving scenarios.

研究の動機と目的

  • タスク分布が未知で、タスク境界が明確でない現実世界の設定において、メタラーニングと継続的学習の限界を克服すること。
  • 事前学習や明示的なタスク境界を必要とせず、オンラインでストリーミング環境において新しいダイナミクスに素早く適応できること。
  • 著しく異なるダイナミクスを示す非定常なロボットタスクにおいて、崩壊的忘却と知識移転の問題を軽減すること。
  • 時間的依存性を、逐次推論フレームワーク内での遷移事前分布を用いてモデリングすること。
  • 混合専門家構成におけるガウス過程ベースのダイナミクスモデルを通じて、データ効率性と不確実性の定量化を達成すること。

提案手法

  • 無限混合ガウス過程(GPs)を用いて、制限のない数のダイナミクスレジームをモデル化できる多様なシステムダイナミクスを表現する。
  • 新しいデータがストリーミングされるのと同時に、逐次的変分推論を適用して混合モデルをリアルタイムで更新し、オンライン学習を実現する。
  • ディリクレ過程から導出された遷移事前分布を導入し、連続するダイナミクス間の時間的依存性を表現することで、タスク変化の検出を向上させる。
  • スパースGP近似と変分推論を用いることで、計算スケーラビリティとデータ効率性を維持する。
  • スティッキーパラメータを用いて、オンライン適応中に誤ったモデル生成を抑えるとともに、モデルの持続性を高める。
  • 各時刻で観測を既存のまたは新しいGPエキスパートに割り当てることで、タスク認識を実施し、以前に学習されたダイナミクスの再利用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1モデルベース強化学習エージェントは、事前学習を必要とせず、非定常環境において未知のダイナミクスに素早く適応できるか?
  • RQ2ストリーミングされるダイナミクスにおける時間的依存性をどのようにモデリングすることで、タスク変化検出を向上させられるか?
  • RQ3オンライン推論を伴うGPsの混合モデルは、ダイナミクスの急激な変化に対応しつつ、崩壊的忘却を回避できるか?
  • RQ4タスク境界が不明な環境において、本手法はメタラーニングおよび継続的学習のベースラインと比較してどのように性能を発揮するか?
  • RQ5非i.i.d.なダイナミクス環境において、遷移事前分布は性能をどの程度向上させるか?

主な発見

  • 本手法は、非定常なCartPole-SwingUpおよびHighway-Intersectionタスクにおいて、MAMLベースのモデルフリーRLおよびDNNベースのベースラインを上回り、特にダイナミクスの変化が生じる状況で顕著な優位性を示した。
  • 本手法はリアルタイムでタスク境界を検出し、新しいダイナミクスに素早く適応でき、必要に応じて新しいGPモデルを生成するか、既存のモデルを再利用する。
  • i.i.d.仮定と比較して、遷移事前分布の導入により、タスク変化検出が著しく向上し、振動と性能低下が減少した。
  • 無限混合GPsにより、予測分布のマルチモーダル性が実現され、著しく異なるダイナミクスに対しても、崩壊的忘却を回避しながら堅牢に処理できる。
  • 特に各ダイナミクスレジームのデータが限られる状況において、深層ニューラルネットワークよりも優れたデータ効率性と不確実性の定量化を達成した。
  • 実験では、MAMLやDNNベースのモデルが局所最適解に閉じ込められるのを回避することができ、特にタスク間でダイナミクスが著しく変化する場合に顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。