Skip to main content
QUICK REVIEW

[論文レビュー] Model-based RL in Contextual Decision Processes: PAC bounds and Exponential Improvements over Model-free Approaches

Wen Sun, Nan Jiang|arXiv (Cornell University)|Nov 21, 2018
Reinforcement Learning in Robotics参考文献 39被引用数 17
ひとこと要約

本稿は、新たな構造的パラメータであるwitness rankによって制御される、文脈的意思決定過程におけるモデルベース強化学習の新規アルゴリズムを導入する。このアルゴリズムは、証明可能なより高いサンプル効率を達成し、因子分解MDPにおいてモデルベース手法が多項式的サンプル複雑性を達成する一方で、モデルフリー手法(OLIVEを含む)は指数的サンプル複雑性を示すことを示し、実現可能性の仮定の下でサンプル効率に指数的差をもたらす。

ABSTRACT

We study the sample complexity of model-based reinforcement learning (henceforth RL) in general contextual decision processes that require strategic exploration to find a near-optimal policy. We design new algorithms for RL with a generic model class and analyze their statistical properties. Our algorithms have sample complexity governed by a new structural parameter called the witness rank, which we show to be small in several settings of interest, including factored MDPs. We also show that the witness rank is never larger than the recently proposed Bellman rank parameter governing the sample complexity of the model-free algorithm OLIVE (Jiang et al., 2017), the only other provably sample-efficient algorithm for global exploration at this level of generality. Focusing on the special case of factored MDPs, we prove an exponential lower bound for a general class of model-free approaches, including OLIVE, which, when combined with our algorithmic results, demonstrates exponential separation between model-based and model-free RL in some rich-observation settings.

研究の動機と目的

  • 豊かな観測を持つ一般化された文脈的意思決定過程におけるモデルベース強化学習の理論的基盤を確立すること。
  • モデルベース強化学習におけるサンプル複雑性を支配する新たな構造的パラメータ「witness rank」を同定すること。
  • 因子分解MDPのような設定において、モデルベース手法がモデルフリー手法に比べて指数的にサンプル効率が良いことを実証すること。
  • witness rankとBellman rankの比較を行い、witness rankは常にそれ以下であり、指数的に小さくなる可能性があることを示すこと。
  • 表形式や高次元の制御理論的仮定に依存しない、一般化されたCDPに対する最初の確実に効率的なモデルベースアルゴリズムを提供すること。

提案手法

  • 一般モデルクラスMを用いた文脈的意思決定過程におけるモデルベース強化学習の新規アルゴリズムを提案する。
  • witness rankを、Bellman誤差フレームワークにおけるwitnessモデル誤差に由来する構造的パラメータとして導入し、サンプル複雑性の上限を定める。
  • エポックとイテレーションの階層的サンプリングと除外戦略を採用し、信頼区間に基づく適応的サンプルサイズを用いる。
  • モデル間の乖離を測るためのwitnessモデル誤差関数W(M, M′, h)を定義し、状態行動分布の期待値を用いる。
  • 集中不等式と和集合不等式を適用し、方策の品質とモデル推定の高確率保証を確保する。
  • 指数型分布族のモデルクラスを分析し、定数倍の範囲でBellman支配が成立することを証明し、このような設定においてwitness rankの使用を正当化する。

実験結果

リサーチクエスチョン

  • RQ1一般化された文脈的意思決定過程において、モデルベース強化学習はモデルフリー強化学習に比べて著しく優れたサンプル複雑性を達成できるか?
  • RQ2表形式や制御理論的設定を超えた文脈で、モデルベース強化学習のサンプル複雑性を捉える構造的パラメータは存在するか?
  • RQ3witness rankは大きさとアルゴリズム的含みにおいてBellman rankとどのように比較できるか?
  • RQ4実現可能性の仮定が成り立つにもかかわらず、OLIVEのようなモデルフリー手法は、豊かな観測を持つ設定(因子分解MDPなど)で確実に非効率的になり得るか?
  • RQ5モデルベース学習におけるより強い実現可能性仮定とサンプル効率の理論的トレードオフは何か?

主な発見

  • 提案されたモデルベースアルゴリズムは、因子分解MDPにおいて多項式的サンプル複雑性を達成するが、OLIVEのようなモデルフリー手法は指数的サンプル複雑性を示す。
  • witness rankはBellman rankを超えることはなく、指数的に小さくなる可能性があり、これによりより優れたサンプル効率が実現される。
  • 因子分解MDPではwitness rankが小さく、高次元の観測下でも効率的な学習が可能である。
  • 真のモデルがモデルクラスに実現可能である限り、出力される方策は高確率でϵ最適であることが保証される。
  • 指数型分布族のモデルでは、witnessモデル誤差が定数倍の範囲でBellman誤差を上界付けるため、実用的状況においてwitness rankの使用が正当化される。
  • 総サンプル複雑性は ˜O((1 + log(4Wκ⋆/κ⋆))H³KW²κ⋆log(Ti⋆,₀|M||F|/δi⋆,i⋆)/(κ⋆ϵ)²) であり、関連パラメータに関して多項式的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。