Skip to main content
QUICK REVIEW

[論文レビュー] No-regret Exploration in Contextual Reinforcement Learning

Aditya Modi, Ambuj Tewari|arXiv (Cornell University)|Mar 14, 2019
Advanced Bandit Algorithms Research参考文献 26被引用数 8
ひとこと要約

本稿は、文脈ベクトルをMDPパラメータにマッピングする一般化線形モデル(GLM)を用いて、文脈付きマルコフ決定過程(CMDP)のためのレギュレータフリー強化学習アルゴリズムを提案する。信頼集合の構築にオンラインニュートンステップを用いた効率的なオンライン更新手法を導入し、先行研究の線形MDP結果と比較してO(√S)の改善を達成するレギュレータ境界を実現する。また、スパarsityなどの構造的GLMパラメータを活用する汎用フレームワークを提供する。

ABSTRACT

We consider the recently proposed reinforcement learning (RL) framework of Contextual Markov Decision Processes (CMDP), where the agent interacts with a (potentially adversarial) sequence of episodic tabular MDPs. In addition, a context vector determining the MDP parameters is available to the agent at the start of each episode, thereby allowing it to learn a context-dependent near-optimal policy. In this paper, we propose a no-regret online RL algorithm in the setting where the MDP parameters are obtained from the context using generalized linear mappings (GLMs). We propose and analyze optimistic and randomized exploration methods which make (time and space) efficient online updates. The GLM based model subsumes previous work in this area and also improves previous known bounds in the special case where the contextual mapping is linear. In addition, we demonstrate a generic template to derive confidence sets using an online learning oracle and give a lower bound for the setting.

研究の動機と目的

  • 制限された線形仮定や正規化されていないダイナミクスに依存する既存のCMDPフレームワークの限界を解決すること。
  • 保証付きのレギュレータ境界を備えた、GLMに基づくCMDPのための効率的なオンライン学習アルゴリズムを開発すること。
  • 線形マッピングケースにおいて、先行研究の境界をO(√S)の要因で改善すること。
  • オンライン学習オラクルを用いて、スパarsityなどの構造的GLMパラメータに適応可能な信頼集合を導出する汎用的手法を提供すること。
  • ロジスティック関数または2次リンク関数を用いるGLM-CMDPにおけるレギュレータ下界を確立すること。

提案手法

  • 文脈ベクトルからMDPパラメータへの一般化線形マッピングを用いたGLM-CMDPフレームワークを提案する。
  • オンラインニュートンステップ(ONS)を用いた効率的な信頼集合構築のために、楽観的探索アルゴリズム(GLM-ORL)を設計する。
  • RLSVIにインspiredされた確率的探索アルゴリズム(GLM-RLSVI)を提案し、経験的ベルンシュタイン型ボーナスに基づくレギュレータ解析を実施する。
  • 任意のGLMパラメータ推定のためのオンラインレギュレータフリーなアルゴリズムを、信頼集合構築法に変換するオンライン学習オラクルを用いる。
  • 次状態遷移モデルに対するホフディン型ボーナスを用いて、価値関数の信頼集合を導出する。
  • GLMリンク関数の強い凸性を活用し、推定誤差をバインドし、1/αに依存するレギュレータ境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1一般化線形パラメータ化を用いたCMDPのための、計算的に効率的かつ統計的に妥当な、ノーレギュレータオンラインRLアルゴリズムを設計可能か?
  • RQ2GLM-CMDPアルゴリズムのレギュレータ境界は、文脈次元d、状態空間サイズS、ホライズンHに関して、先行研究と比較してどのようにスケーリングされるか?
  • RQ3既存のOFUベースのアプローチと比較して、線形ケースにおいてO(√S)の要因でレギュレータ境界を改善可能か?
  • RQ4特にスパarsityなどの構造を持つ場合に、オンライン学習オラクルを用いてGLMベースのMDPの信頼集合を導出する汎用的手法が存在するか?
  • RQ5ロジスティック関数または2次リンク関数を用いるGLM-CMDPにおけるレギュレータの根本的限界(下界)は何か?

主な発見

  • 提案されたGLM-ORLアルゴリズムは、GLM-CMDPに対してÕ(H√(dS K))のレギュレータ境界を達成し、線形ケースにおいて、先行研究のOFUベース手法と比較してO(√S)の改善を達成する。
  • GLM-RLSVIアルゴリズムは、GLM-ORLと同程度の頻度的レギュレータ境界を提供するベイジアン境界を達成し、H、d、S、Kに類似した依存性を示す。
  • オンラインニュートンステップによる信頼集合構築は、時間的・空間的計算量の効率性を実現し、標準的なOFUアプローチのラウンド数に比例するスケーリングを回避する。
  • 任意のオンラインレギュレータフリーなGLMパラメータ推定アルゴリズムを信頼集合に変換する汎用的変換を提供し、パラメータがスパースな場合にタイトな境界を達成可能にする。
  • ロジスティック関数または2次リンク関数を用いるGLM-CMDPに対して、Ω(H√(dK))のレギュレータ下界を確立し、現在の上界がほぼタイトであることを示唆する。
  • 残りのレギュレータギャップ(O(H√(dS)))を埋めるのは非自明であることが同定され、これは文脈変数に沿った価値関数に構造が欠如していること、およびフェーズ間で独立にサンプリングすることが難しいことによる挑戦に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。