Skip to main content
QUICK REVIEW

[論文レビュー] Markov Decision Processes with Continuous Side Information

Aditya Modi, Nan Jiang|arXiv (Cornell University)|Nov 15, 2017
Advanced Bandit Algorithms Research参考文献 20被引用数 6
ひとこと要約

本稿は、連続的なサイド情報を持つ文脈的マルコフ決定過程(CMDP)における強化学習のためのアルゴリズムを提案する。滑らかなMDPの変化を想定するCover-Rmaxと、MDPの線形結合を仮定するKWIK_LR-Rmaxを導入する。PACバウンドを確立し、一般設定では文脈次元に指数関数的に依存するサンプル複雑性を示すが、線形構造を活用することでKWIK学習技術により著しく改善されることを示す。

ABSTRACT

We consider a reinforcement learning (RL) setting in which the agent interacts with a sequence of episodic MDPs. At the start of each episode the agent has access to some side-information or context that determines the dynamics of the MDP for that episode. Our setting is motivated by applications in healthcare where baseline measurements of a patient at the start of a treatment episode form the context that may provide information about how the patient might respond to treatment decisions. We propose algorithms for learning in such Contextual Markov Decision Processes (CMDPs) under an assumption that the unobserved MDP parameters vary smoothly with the observed context. We also give lower and upper PAC bounds under the smoothness assumption. Because our lower bound has an exponential dependence on the dimension, we consider a tractable linear setting where the context is used to create linear combinations of a finite set of MDPs. For the linear setting, we give a PAC learning algorithm based on KWIK learning techniques.

研究の動機と目的

  • 各エピソードが文脈依存のMDPに従う、多数または無限に近いMDPにおいて近似的最適方策を学習する課題に対処すること。
  • MDPパラメータが連続的文脈とともに滑らかに変化する状況をモデル化し、類似した文脈間でデータを共有可能にする。
  • 有限個のMDPの線形結合といった構造的仮定を活用してサンプル複雑性を低減すること。
  • 滑らかさおよび線形パラメトリック仮定の下で学習効率を定量化する形式的なPAC一般化バウンドを提供すること。
  • 多くの既存のPAC-MDP手法とは異なり、敵対的文脈シーケンスをサポートすること。

提案手法

  • MDPパラメータが文脈に対して滑らかに変化すると仮定することで、類似した文脈間でデータをプールするモデルベースPAC探索アルゴリズムであるCover-Rmaxを提案する。
  • 任意のPACアルゴリズムが滑らかなCMDPに対しては文脈次元に指数関数的に依存しなければならないことを示す下界構成を提示し、本質的な難易度を示す。
  • 文脈が有限個の未知MDPの線形結合として構成される線形設定を導入し、構造的学習を可能にする。
  • 線形結合モデルにおけるMDPパラメータの効率的推定のため、特にKWIK線形回帰をサブルーチンとして採用する。
  • KWIK回帰とRmax風の探索を統合することで、サンプル効率の高い学習を保証するKWIK_LR-Rmaxアルゴリズムを設計する。
  • 両アルゴリズムのPACバウンドを導出し、一般の滑らかさケースと比較して線形仮定下でサンプル複雑性が著しく改善されることを示す。

実験結果

リサーチクエスチョン

  • RQ1MDPパラメータが文脈とともに滑らかに変化する連続的文脈付きCMDPにおいて、学習の根本的サンプル複雑性の限界は何か?
  • RQ2有限個のMDPの線形結合といった構造的仮定が、CMDP学習におけるサンプル複雑性を著しく低減できるか?
  • RQ3滑らかさ仮定の下で、CMDPにおける学習のサンプル複雑性は文脈次元に対してどのようにスケーリングするか?
  • RQ4KWIK学習技術は、Rmaxのようなモデルベース強化学習アルゴリズムと効果的に組み合わせられ、線形CMDPにおけるPAC学習を達成できるか?
  • RQ5標準的なPAC-MDP手法を文脈依存ダイナミクスを持つCMDPに適用した場合の制限は何か?

主な発見

  • 本稿では、任意のPACアルゴリズムが滑らかなCMDPに対しては文脈次元に指数関数的に依存しなければならないことを示す下界を確立し、本質的な困難さを示している。
  • 一般の滑らかなCMDP設定において、Cover-Rmaxアルゴリズムは文脈次元に指数関数的に依存するサンプル複雑性でPAC学習を達成する。
  • 線形結合仮定下では、KWIK_LR-Rmaxアルゴリズムが著しく改善されたサンプル複雑性を達成し、文脈次元への依存が対数的または多項式的項にまで削減される。
  • KWIK_LR-RmaxのPACバウンドは、アグノスティックケースでは次元に対して指数関数的に増加する既知のKWIK線形回帰バウンドに依存しており、モデリング仮定の重要性を強調している。
  • 提案されたアルゴリズムは、敵対的文脈シーケンスをサポートするが、多くの既存のPAC-MDP手法とは異なり、i.i.d. または確率的文脈を仮定しない。
  • 本稿では、状態空間に文脈を統合することで計算コストおよび記憶コストが上昇することを示しており、一方で提案手法は文脈と計画を分離することでこれを回避する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。