Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting

Ziping Xu, Ambuj Tewari|arXiv (Cornell University)|Feb 6, 2020
Reinforcement Learning in Robotics参考文献 32被引用数 5
ひとこと要約

本稿では、要因的マーケフ決定過程(FMDP)に対するオракル効率の良い強化学習アルゴリズムを提示し、新たな接続性測度「要因的スパン」を導入することで、よりタイトなレグレットバウンドを達成する。提案されたDORLおよびPSRLアルゴリズムは、標準MDPに特化した場合に最適に近いレグレットバウンドを達成するが、FSRLアルゴリズムは、直径ではなく要因的スパンを用いることで、上界と下界のレグレットバウンドの差を縮小する。

ABSTRACT

We study reinforcement learning in non-episodic factored Markov decision processes (FMDPs). We propose two near-optimal and oracle-efficient algorithms for FMDPs. Assuming oracle access to an FMDP planner, they enjoy a Bayesian and a frequentist regret bound respectively, both of which reduce to the near-optimal bound $\widetilde{O}(DS\sqrt{AT})$ for standard non-factored MDPs. We propose a tighter connectivity measure, factored span, for FMDPs and prove a lower bound that depends on the factored span rather than the diameter $D$. In order to decrease the gap between lower and upper bounds, we propose an adaptation of the REGAL.C algorithm whose regret bound depends on the factored span. Our oracle-efficient algorithms outperform previously proposed near-optimal algorithms on computer network administration simulations.

研究の動機と目的

  • 非エピソード的要因的MDPに対して、FMDPプランナーオラクルを多項式回呼び出すことで、オラクル効率の良いアルゴリズムを設計すること。
  • 標準的な直径の代わりに、よりタイトな要因的特化型接続性測度を用いることで、FMDPにおけるレグレットバウンドを改善すること。
  • 直径を要因的スパンに置き換えることで、FMDPにおける既存の上界と下界のレグレットバウンドの差を縮小すること。
  • 特にコンピューターネットワーク管理を含む実世界のシミュレーションで、提案されたアルゴリズムを検証すること。

提案手法

  • 非エピソード的設定において、近似的に最適なレグレットバウンドを達成するFMDPプランナーオラクルを用いたDORLおよびPSRLアルゴリズムを提案する。
  • 従来の直径の代わりに、FMDPにおけるよりタイトな接続性測度として「要因的スパン」を導入する。
  • REGAL.Cアルゴリズムを変形して、要因的スパンに依存するレグレットスケーリングを達成するFSRLに適応する。
  • 要因的スパンに依存するレグレット下界を証明し、FMDP文脈におけるその最適性を示す。
  • 動的ベイジアンネットワークを用いてFMDP遷移関数をコンパクトに表現し、オラクルアクセスによる効率的な計画を可能にする。
  • 要因ごとのバイアスベクトルスパンと報酬分解を用いて、価値関数差のよりタイトなバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1非エピソード的FMDPに対して、多項式回のオラクル呼び出しで近似的に最適なレグレットを達成するオラクル効率の良いアルゴリズムを設計できるか?
  • RQ2要因的スパン測度は、FMDPにおける標準的な直径よりもタイトなレグレットバウンドを提供するか?
  • RQ3直径を要因的スパンに置き換えることで、FMDPにおける上界と下界のレグレットバウンドの差を縮小できるか?
  • RQ4提案されたアルゴリズムは、コンピューターネットワーク管理のような実際のスケールの大きな設定でどのように動作するか?

主な発見

  • DORLおよびPSRLアルゴリズムは、頻度主義的およびベイジアン的レグレットバウンドを $\widetilde{O}(DS\sqrt{AT})$ のオーダーで達成し、標準MDPに特化した場合に既知の最良のバウンドと一致する。
  • 要因的スパン測度が直径よりもタイトな接続性指標であることが示され、これは、レグレット下界が要因的スパンに依存するものであることを意味する。
  • FSRLアルゴリズムは、要因的スパンに依存することで、直径と要因数 $m$ への依存性を両方改善し、レグレットのギャップを縮小する。
  • 提案されたアルゴリズムは、コンピューターネットワーク管理のシミュレーションにおいて、先行する近似的に最適なアルゴリズムを上回り、実用的な効率性を示す。
  • 理論的分析により、レグレット下界が要因的スパンに比例することが証明され、上界がこれと一致するため、新しい測度のタイトさが確認される。
  • 構造的FMDPにおいて、要因的スパンの使用により、直径に基づくバウンドに比べて上界が $1/m$ 倍改善される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。