Skip to main content
QUICK REVIEW

[論文レビュー] Sample Complexity of Reinforcement Learning using Linearly Combined Model Ensembles

Aditya Modi, Nan Jiang|arXiv (Cornell University)|Oct 23, 2019
Reinforcement Learning in Robotics参考文献 32被引用数 9
ひとこと要約

本稿では、複数の事前学習済みで不正確なシミュレータを状態に依存する線形アンサンブルで組み合わせることで真の環境を近似する、サンプル効率の良い強化学習アルゴリズムを提案する。状態空間や行動空間のサイズに依存せず、未知パrameter数に多項式的に依存するサンプル複雑性を達成し、自然な仮定の下で妥当な効率性を示すモデル選択を可能にするとともに、硬度に関する指数的下界を示す。

ABSTRACT

Reinforcement learning (RL) methods have been shown to be capable of learning intelligent behavior in rich domains. However, this has largely been done in simulated domains without adequate focus on the process of building the simulator. In this paper, we consider a setting where we have access to an ensemble of pre-trained and possibly inaccurate simulators (models). We approximate the real environment using a state-dependent linear combination of the ensemble, where the coefficients are determined by the given state features and some unknown parameters. Our proposed algorithm provably learns a near-optimal policy with a sample complexity polynomial in the number of unknown parameters, and incurs no dependence on the size of the state (or action) space. As an extension, we also consider the more challenging problem of model selection, where the state features are unknown and can be chosen from a large candidate set. We provide exponential lower bounds that illustrate the fundamental hardness of this problem, and develop a provably efficient algorithm under additional natural assumptions.

研究の動機と目的

  • 事前学習済みで不正確なシミュレータのアンサンブルを活用して真の環境を近似する、サンプル効率の良い強化学習アルゴリズムの開発。
  • サンプル複雑性が状態空間や行動空間のサイズに依存せず、未知パrameter数にのみ依存することの保証。
  • 状態特徴量が未知であるという困難な問題に対し、自然な仮定の下で証明可能な効率性を持つモデル選択アルゴリズムの提案。
  • 状態特徴に関する事前知識がない状況において、モデル選択のサンプル複雑性に関する指数的下界を確立し、根本的な限界を特定すること。

提案手法

  • 真の環境を、状態特徴と未知パrameterに依存するK個の基本MDPの状態に依存する線形結合としてモデル化する。
  • 候補特徴集合を段階的に精錬する階層的アルゴリズムを用い、組み合わせモデルから近似的に最適な方策を学習するサブルーチン(アルゴリズム1)を活用する。
  • 固定された軌道数でモンテカルロロールアウトを実行し、高い信頼性で方策のリターンを推定する。
  • 候補特徴集合に対して二分探索を適用し、複雑さで分割しながら徐々に探索空間を精錬する。
  • 基本モデルの組み合わせに線形性の仮定を置き、信頼区間を用いて探索を誘導する。
  • 推定リターンがしきい値を超えることで終了する条件を導入し、高い確率で近似的最適性を保証する。

実験結果

リサーチクエスチョン

  • RQ1状態空間や行動空間のサイズに依存しないサンプル複雑性で、事前学習済みで不正確なシミュレータの線形アンサンブルを用いて、近似的最適方策を学習可能か?
  • RQ2状態特徴が未知であり、多数の候補集合から選択しなければならない場合、モデル選択の根本的サンプル複雑性の限界は何か?
  • RQ3例えば真のモデルが特徴クラスに実現可能であるという自然な仮定の下で、証明可能な効率性を持つモデル選択アルゴリズムを設計可能か?
  • RQ4このようなアンサンブルベースのモデル学習において、サンプル複雑性は未知パrameter数とホライズンにどのように依存するか?
  • RQ5特にサンプル効率の観点から、知識なしのモデル選択の本質的限界は何か、MDPにおいて。

主な発見

  • ε-最適方策を学習するためのサンプル複雑性は、Õ(d*³K²H²/ε² · log d* · log(d*KHN/δ)) であり、d* は最適特徴集合の次元である。
  • サンプル複雑性は未知パrameter数に多項式的に依存し、状態空間や行動空間のサイズに依存しない。
  • 状態特徴に関する事前知識がない状況において、モデル選択の指数的下界を確立し、知識なしの選択が本質的に困難であることを示した。
  • アルゴリズムは、複数回の反復と推定ステップにおける和集合の不等式を用い、確率1 - δで成功を保証する。
  • モデルの不正確さに対して頑健であり、アンサンブルベースの近似により、シミュレーションから現実環境への方策の転移を可能にする。
  • 解析により、アルゴリズムの性能が全候補特徴集合ではなく、最適特徴表現の内因的次元性にのみ依存することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。