Skip to main content
QUICK REVIEW

[論文レビュー] Oracle-Efficient Regret Minimization in Factored MDPs with Unknown Structure

Aviv Rosenberg, Yishay Mansour|arXiv (Cornell University)|Sep 13, 2020
Reinforcement Learning in Robotics参考文献 35被引用数 5
ひとこと要約

本稿では、未知の構造を有する要因分解MDP(FMDP)における、初めてのオракル効率的レグレット最小化アルゴリズムを提示する。これは、不確実性下での楽観主義と統計的スコープ学習を組み合わせたものであり、プランナーオーキュラルが非要因分解行動を提供する場合でも、FMDPのエンコーディングに多項式的に依存する $√{T}$ の近似的に最適なレグレットを達成する。また、最先端の上界と一致する、新たなミニマックス下界を確立する。

ABSTRACT

We study regret minimization in non-episodic factored Markov decision processes (FMDPs), where all existing algorithms make the strong assumption that the factored structure of the FMDP is known to the learner in advance. In this paper, we provide the first algorithm that learns the structure of the FMDP while minimizing the regret. Our algorithm is based on the optimism in face of uncertainty principle, combined with a simple statistical method for structure learning, and can be implemented efficiently given oracle-access to an FMDP planner. Moreover, we give a variant of our algorithm that remains efficient even when the oracle is limited to non-factored actions, which is the case with almost all existing approximate planners. Finally, we leverage our techniques to prove a novel lower bound for the known structure case, closing the gap to the regret bound of Chen et al. [2021].

研究の動機と目的

  • 学習者が要因分解構造を把握できない非エピソード的要因分解MDPにおける、レグレット最小化の未解決問題に取り組むこと。
  • FMDPプランナーオーキュラルへのアクセスを介して、構造学習を実行しながら計算効率を維持するアルゴリズムを設計すること。
  • 既存の近似プランナーよりも一般的な非要因分解行動オーキュラルに対応できるように、フレームワークを拡張すること。
  • 構造が既知のFMDPにおける、新たなミニマックス下界を証明し、既存の最良上界とのギャップを埋めること。

提案手法

  • 一貫性のあるスコープの概念を導入し、学習中に一貫性のないスコープを統計的検定で除外する。
  • 不確実な構造のもとで探索と方策選択をガイドするため、不確実性下での楽観主義の原則を採用する。
  • 候補となる一貫性のあるスコープ上で楽観的なMDPを構築し、FMDPプランナーオーキュラルを用いて方策を計算する。
  • オーキュラルアクセスを超える計算コストを増加させることなく、構造学習をレグレット最小化のループに統合する。
  • 計画と探索のコンponentsを変更することで、非要因分解行動オーキュラルに対応できるようにアルゴリズムを適応化する。
  • アルゴリズム的枠組みを活用し、スコープサイズ $m$ に指数関数的に依存し、要因数 $d$ に $√{d}$ に依存する新たな下界を導出する。

実験結果

リサーチクエスチョン

  • RQ1学習者が下位構造を把握できない状況下でも、オーキュラル効率的であるレグレット最小化が可能か?
  • RQ2構造学習を、指数的計算コストを増加させることなく、楽観的レグレット最小化フレームワークに統合できるか?
  • RQ3プランナーオーキュラルが非要因分解行動のみをサポートする場合でも、近似的に最適なレグレットバウンドを維持できるか?
  • RQ4構造が既知の要因分解MDPにおける、ミニマックス下界は何か? そして、既存の最良上界と一致するか?
  • RQ5部分的なドメイン知識は構造学習プロセスに利益をもたらすか? また、その知識は効率的にアルゴリズムに統合可能か?

主な発見

  • 提案されたSLF-UCRLアルゴリズムは、$\sqrt{T}$ の近似的に最適なレグレットスケーリングを達成し、表形式MDPのレグレットバウンドよりも指数的に小さい。
  • プランナーオーキュラルが非要因分解行動を返す場合でも、アルゴリズムはオーキュラル効率性を維持し、既存の近似プランナーやの互換性を確保する。
  • SysAdminドメインにおける数値実験では、SLF-UCRLが構造の完全な知識を仮定する要因分解UCRLアルゴリズムと同等のレグレットを達成している。
  • アルゴリズムは時間の経過とともに一貫性のないスコープを効果的に排除しており、実際の構造学習の有効性を示している。
  • 本稿では、有限ホライズンFMDPに対して、$\Omega\bigl{(}\sqrt{\frac{d}{\log d}HW^{m}|A|T}\bigr{)}$ の新たなミニマックス下界を確立し、Chenら[2021]の上界と対数要因を除いて一致する。
  • 下界により、レグレットがスコープサイズ $m$ に対して指数関数的に増加する必要があることが証明され、分野における重要な未解決問題が解決された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。