Skip to main content
QUICK REVIEW

[論文レビュー] MBMF: Model-Based Priors for Model-Free Reinforcement Learning

Somil Bansal, Roberto Calandra|arXiv (Cornell University)|Sep 10, 2017
Reinforcement Learning in Robotics参考文献 27被引用数 20
ひとこと要約

本稿では、学習されたダイナミクスモデルを用いてベイズ最適化における事前分布を提供することにより、モデルベース(MB)とモデルフリーフレーバー(MF)強化学習を統合する確率的フレームワークMBMFを提案する。モデル予測によるコスト推定と直接のコスト観測を組み合わせることで、MBMFはモデルバイアスを克服しつつも高速な収束を維持し、ナビゲーションおよび操作タスクにおいて、純粋なMB、MF、ハイブリッド手法を上回る性能を発揮する。

ABSTRACT

Reinforcement Learning is divided in two main paradigms: model-free and model-based. Each of these two paradigms has strengths and limitations, and has been successfully applied to real world domains that are appropriate to its corresponding strengths. In this paper, we present a new approach aimed at bridging the gap between these two paradigms. We aim to take the best of the two paradigms and combine them in an approach that is at the same time data-efficient and cost-savvy. We do so by learning a probabilistic dynamics model and leveraging it as a prior for the intertwined model-free optimization. As a result, our approach can exploit the generality and structure of the dynamics model, but is also capable of ignoring its inevitable inaccuracies, by directly incorporating the evidence provided by the direct observation of the cost. Preliminary results demonstrate that our approach outperforms purely model-based and model-free approaches, as well as the approach of simply switching from a model-based to a model-free setting.

研究の動機と目的

  • モデルベースとモデルフリー強化学習の間のギャップを埋め、それぞれの長所を統合すること。
  • 正確なダイナミクスモデルを有しても、依然として部分的最適な方策に陥る可能性のあるMB手法におけるモデルバイアスを是正すること。
  • モデル予測と実際のコスト観測の両方を活用することで、方策学習におけるデータ効率性とロバスト性を向上させること。
  • 純粋なMF手法よりも高速な収束を実現しつつ、学習されたダイナミクスモデルの不正確さを回避し、一般化性能を維持すること。

提案手法

  • 環境との相互作用から得られたデータを用いて、与えられた方策下での状態軌道を予測する確率的ダイナミクスモデルを学習する。
  • ダイナミクスモデルから得られる予測コストが、ベイズ最適化に基づくモデルフリー方策探索における事前分布として機能する。
  • モデル予測の不確実性と直接的なコスト観測の証拠を統合するための統合確率的フレームワークを用いる。
  • 方策探索は後方分布に基づいて反復的に更新され、モデル予測と現実世界のフィードバックのバランスを取る。
  • モデルの不正確さを是正し、バイアスを低減するために、動的に実際のコスト測定値を統合する。
  • ダイナミクスモデリングにはガウス過程を、方策探索にはベイズ最適化を用いてフレームワークを実装する。

実験結果

リサーチクエスチョン

  • RQ1モデルベースのダイナミクスモデルを、モデルフリー強化学習におけるデータ効率性を向上させるための事前分布として利用可能か?
  • RQ2方策最適化の過程で、学習されたダイナミクスモデルのモデルバイアスをどのように是正できるか?
  • RQ3モデル予測と実際のコスト観測を組み合わせることで、純粋なMBまたはMF手法よりも高速かつロバストな方策学習が可能か?
  • RQ4モデルフリー最適化の過程で、モデルベースの事前分布を更新する最適な頻度は何か?

主な発見

  • 2次元ナビゲーションタスクにおいて、MBMFは純粋なMB手法がモデルの不正確さにより失敗する中で、常に目的に到達するなど、純粋なMBおよびMF手法を上回る性能を発揮する。
  • 3自由度のロボットアーム操作タスクにおいて、最適なハイパーパrameter(F=1)を用いたMBMFは、MB+MFスイッチング戦略を含むすべてのベースラインを上回り、性能のばらつきも低い。
  • 接触を伴う複雑なダイナミクスを要するタスクにおいて、MBMFは純粋なMB手法よりも収束が早く、最終的な性能も優れている。
  • 事前分布の更新頻度(F)が低すぎる場合には、MBMFは純粋なMBに遅れをとるが、最適なFを用いることで、モデル構造と実際のコスト証拠の両方を効果的に活用する。
  • 軌道比較の結果、MBMFは目的に近い位置に物体を押し出すのに対し、純粋なMB手法はモデルバイアスのためタスクを達成できていない。
  • 訓練データの変動に対してロバストであることが、他のベースラインと比較して著しく低い性能ばらつきからも裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。