Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Markov Decision Processes using Generalized Linear Models

Aditya Modi, Ambuj Tewari|arXiv (Cornell University)|Apr 28, 2019
Advanced Bandit Algorithms Research参考文献 11被引用数 8
ひとこと要約

本稿では、一般化線形モデル(GLMs)を用いてパラメータ化される文脈的マルコフ決定過程(CMDPs)のための、レギュレータが不要なオンライン強化学習アルゴリズム、GL-ORLを提案する。この手法は、信頼集合を構築するために効率的なオンラインニュートンステップ更新を用い、特にロジットリンクの場合に改善されたレギュレータバウンドを確立する。文脈依存の環境におけるエピソード的相互作用において、メモリ効率の高い学習を可能にする。

ABSTRACT

We consider the recently proposed reinforcement learning (RL) framework of Contextual Markov Decision Processes (CMDP), where the agent has a sequence of episodic interactions with tabular environments chosen from a possibly infinite set. The parameters of these environments depend on a context vector that is available to the agent at the start of each episode. In this paper, we propose a no-regret online RL algorithm in the setting where the MDP parameters are obtained from the context using generalized linear models (GLMs). The proposed algorithm exttt{GL-ORL} relies on efficient online updates and is also memory efficient. Our analysis of the algorithm gives new results in the logit link case and improves previous bounds in the linear case. Our algorithm uses efficient Online Newton Step updates to build confidence sets. Moreover, for any strongly convex link function, we also show a generic conversion from any online no-regret algorithm to confidence sets.

研究の動機と目的

  • 文脈ベクトルに依存する環境パラメータを持つ文脈的MDPのためのノーレギュレータオンラインRLアルゴリズムを開発すること。
  • スケーラブルで構造的な文脈依存環境の表現を可能にするために、MDPパラメータを一般化線形モデル(GLMs)でモデル化すること。
  • おそらく無限大のMDPを含むエピソード的学習設定において、メモリ効率と高速なオンライン更新を保証すること。
  • ロジットリンク関数におけるよりタイトなレギュレータバウンドを導出すること。また、線形ケースにおいて先行研究を改善すること。
  • 任意のオンラインノーレギュレータアルゴリズムを、GLMベースのCMDPsにおける信頼集合構築メカニズムに変換する汎用的手法を提供すること。

提案手法

  • アルゴリズムGL-ORLは、オンラインの方法でモデルパラメータの信頼集合を維持・更新するために、オンラインニュートンステップ更新を用いる。
  • MDPの遷移関数および報酬関数を、文脈ベクトルでパラメータ化された一般化線形モデル(GLMs)としてモデル化する。
  • 尤度関数のヘッセ行列を用いて信頼集合を構築し、リンク関数の湾曲度を活用してよりタイトな不確実性推定を実現する。
  • 任意の強凸リンク関数に対して、任意のオンラインノーレギュレータアルゴリズムを信頼集合構築メカニズムに変換する汎用フレームワークを提供する。
  • 信頼集合に基づく上側信頼区間を用いて、探索と活用のバランスを取ることで、ノーレギュレータ学習を保証する。
  • 完全な履歴を保存しないで、十分統計量の再帰的更新に依存することで、メモリ使用量を低く抑える。

実験結果

リサーチクエスチョン

  • RQ1GLMでパラメータ化された環境を有するCMDPsのためのノーレギュレータオンラインRLアルゴリズムを設計できるか?
  • RQ2このような設定において、効率的かつメモリ効率の良いオンライン更新をどのように達成できるか?
  • RQ3先行研究と比較して、ロジットリンク関数においてどの程度のレギュレータバウンドの改善が達成できるか?
  • RQ4GLMベースのCMDPsにおいて、オンラインノーレギュレータアルゴリズムから信頼集合構築への汎用的変換を確立できるか?
  • RQ5オンラインニュートンステップ更新の使用が、信頼集合の品質およびレギュレータパフォーマンスにどのように寄与するか?

主な発見

  • GL-ORLアルゴリズムは、GLMでパラメータ化されたMDPを有するCMDPsの文脈で、時間に伴い非線形に増加するレギュレータを保証する。
  • ロジットリンク関数の場合、既存の文献で知られていた結果を上回る、新たなレギュレータバウンドを確立した。
  • 線形ケースにおいて、GL-ORLが達成するレギュレータバウンドは、以前の結果を改善しており、よりタイトな性能保証を示している。
  • オンラインニュートンステップ更新の使用により、効率的かつ正確な信頼集合構築が可能となり、探索と活用のトレードオフに不可欠である。
  • 強凸リンク関数を有するGLMベースのCMDPsにおいて、任意のオンラインノーレギュレータアルゴリズムを信頼集合構築手法に変換する汎用的メカニズムが、証明された。
  • アルゴリズムは、完全なデータ履歴の保存を避けて、再帰的更新に依存することで、メモリ効率を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。