Skip to main content
QUICK REVIEW

[論文レビュー] Near-optimal Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms for the Non-episodic Setting.

Ziping Xu, Ambuj Tewari|arXiv (Cornell University)|Feb 6, 2020
Reinforcement Learning in Robotics参考文献 6被引用数 7
ひとこと要約

本稿では、非エピソード的設定下における因数分解MDPにおける、近似的に最適でオракル効率の良い2つのアルゴリズムを提示する。これらは、標準MDPにおける近似的に最適な境界と一致する、$acksim{O}(DSackslashsqrt{AT})$ のレグレットバウンドを達成する。また、直径ではなくバイアスベクトルのスパンに依存する新たな下界を導入し、因数分解MDPでは直径に基づく境界が任意に緩いことがあることを示している。

ABSTRACT

We study reinforcement learning in factored Markov decision processes (FMDPs) in the non-episodic setting. We focus on regret analyses providing both upper and lower bounds. We propose two near-optimal and oracle-efficient algorithms for FMDPs. Assuming oracle access to an FMDP planner, they enjoy a Bayesian and a frequentist regret bound respectively, both of which reduce to the near-optimal bound $\widetilde{O}(DS\sqrt{AT})$ for standard non-factored MDPs. Our lower bound depends on the span of the bias vector rather than the diameter $D$ and we show via a simple Cartesian product construction that FMDPs with a bounded span can have an arbitrarily large diameter, which suggests that bounds with a dependence on diameter can be extremely loose. We, therefore, propose another algorithm that only depends on span but relies on a computationally stronger oracle. Our algorithms outperform the previous near-optimal algorithms on computer network administrator simulations.

研究の動機と目的

  • 非エピソード的設定下における因数分解MDPに対する、効率的な強化学習アルゴリズムの設計という課題に取り組む。
  • 構造的環境においてよりタイトな指標となるバイアスベクトルのスパンに依存するように、因数分解MDPにおけるレグレットバウンドを改善する。
  • FMDPプランナへのアクセスのみを要するオラクル効率の良いアルゴリズムを開発し、実用的実装可能性を確保する。
  • 因数分解MDPにおける直径ベースのレグレットバウンドの限界を示す理論的下界を確立する。

提案手法

  • FMDPプランナーオラクルに依存する2つのアルゴリズムを提案:1つはベイジアンレグレットバウンド、もう1つは頻度主義レグレットバウンド。
  • 直径Dではなくバイアスベクトルのスパンに依存する、新たなレグレット下界を導出する。
  • カルテシアン積構成を用いて、スパンが有界なFMDPが任意に大きな直径を取ることを示し、直径ベースの境界が無効であることを示す。
  • スパンにのみ依存するが、より強い計算オラクルを必要とする2番目のアルゴリズムを導入する。
  • 要因のスパarsityを活かした、因数分解構造に特化したレグレット解析技術を用いる。
  • 標準MDPにおけるレグレットバウンドを$\backsim{O}(DS\backslashsqrt{AT})$ に短縮し、既知の近的最適境界と一致させる。

実験結果

リサーチクエスチョン

  • RQ1非エピソード的設定下における因数分解MDPに対して、近的最適なレグレットを達成するオラクル効率の良い強化学習アルゴリズムを設計できるか?
  • RQ2因数分解MDPにおいて、バイアスベクトルのスパンは直径Dと比較して、どのように複雑さの指標として機能するか?
  • RQ3因数分解MDPにおける直径ベースのレグレットバウンドの限界を示す下界を構築できるか?
  • RQ4オラクルの計算的強度と、レグレットバウンドにおけるスパンと直径への依存性のトレードオフは何か?
  • RQ5提案されたアルゴリズムは、ネットワーク管理のような実用的設定において、先行手法を上回る性能を示すか?

主な発見

  • 提案されたアルゴリズムは、標準MDPに対して$\backsim{O}(DS\backslashsqrt{AT})$ のレグレットバウンドを達成し、既知の近的最適境界と一致する。
  • 直径Dではなくバイアスベクトルのスパンに依存する、新たな下界が確立された。
  • カルテシアン積構成により、スパンが有界なFMDPが任意に大きな直径を取ることを示し、直径ベースの境界が非常に緩くなる可能性があることが明らかになった。
  • スパンにのみ依存するが、より強い計算オラクルを必要とする代替アルゴリズムが提案された。
  • コンピュータネットワーク管理タスクのシミュレーションにおいて、従来の近的最適アルゴリズムを上回る性能を示した。
  • 結果から、多くの構造的環境において、スパンは直径よりも適切な複雑さの指標であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。