Skip to main content
QUICK REVIEW

[論文レビュー] Exploration Bonus for Regret Minimization in Undiscounted Discrete and Continuous Markov Decision Processes

Jian Qian, Ronan Fruit|arXiv (Cornell University)|Dec 11, 2018
Advanced Bandit Algorithms Research参考文献 13被引用数 4
ひとこと要約

本稿では、割引なしのマルコフ決定過程(MDP)における効率的な探索アルゴリズムとして、SCAL+ および C-SCAL+ を提案する。これらのアルゴリズムは、探索ボーナスを用いることで、サブ線形なレグレットを達成する。経験的に推定されたMDPにボーナス項を加えて直接計画を実行することで、従来の楽観的アルゴリズム(例:SCAL、UCCRL)のレグレットバウンドを達成する一方で、計算複雑性を著しく低減し、連続状態の割引なしMDPにおけるレグレット保証付きで実装可能なアルゴリズムとして初めてのものである。

ABSTRACT

We introduce and analyse two algorithms for exploration-exploitation in discrete and continuous Markov Decision Processes (MDPs) based on exploration bonuses. SCAL$^+$ is a variant of SCAL (Fruit et al., 2018) that performs efficient exploration-exploitation in any unknown weakly-communicating MDP for which an upper bound C on the span of the optimal bias function is known. For an MDP with $S$ states, $A$ actions and $Γ\leq S$ possible next states, we prove that SCAL$^+$ achieves the same theoretical guarantees as SCAL (i.e., a high probability regret bound of $\widetilde{O}(C\sqrt{ΓSAT})$), with a much smaller computational complexity. Similarly, C-SCAL$^+$ exploits an exploration bonus to achieve sublinear regret in any undiscounted MDP with continuous state space. We show that C-SCAL$^+$ achieves the same regret bound as UCCRL (Ortner and Ryabko, 2012) while being the first implementable algorithm with regret guarantees in this setting. While optimistic algorithms such as UCRL, SCAL or UCCRL maintain a high-confidence set of plausible MDPs around the true unknown MDP, SCAL$^+$ and C-SCAL$^+$ leverage on an exploration bonus to directly plan on the empirically estimated MDP, thus being more computationally efficient.

研究の動機と目的

  • 割引なしMDPにおける、証明可能なレグレット保証付きの効率的な探索・活用アルゴリズムの開発。
  • 高信頼性のMDPの集合を維持する必要がある従来の楽観的アルゴリズムの計算非効率性の解消。
  • バンディットや割引ありMDPで一般的に用いられる探索ボーナスを、割引なしで一般化された無限時刻のMDPへと拡張すること。
  • 連続状態の割引なしMDPにおける、初めての実装可能なアルゴリズムとしてのレグレット保証の提供。
  • SCAL や UCCRL の理論的レグレットバウンドを維持しつつ、計算複雑性を著しく低減すること。

提案手法

  • SCAL+ は、離散MDPにおける経験的報酬に探索ボーナスを加えることで、妥当なMDPの高信頼性集合を維持するのではなく、推定MDP上で直接計画を実行できるようにする。
  • SCAL+ の探索ボーナスは、最適バイアス関数のスパンから導出され、$\widetilde{O}(c / \sqrt{N(s,a)})$ のスケーリングを示す。ここで $c$ はバイアススパンの上界である。
  • C-SCAL+ は、関数近似を用いて連続状態MDPに探索ボーナスのアプローチを拡張し、サブ線形なレグレットを保証する。
  • 両アルゴリズムは、不確実性の面前での楽観主義(OFU)の原則に従うが、妥当なMDPの集合を維持する計算コストを回避する。
  • エピソードベースの学習と停止時刻を用いることで、十分な探索を確保し、推定MDPに対する高確率の信頼性を維持する。
  • 理論的分析により、SCAL+ が SCAL と同等の $\widetilde{O}(c\sqrt{\Gamma SAT})$ のレグレットを達成するが、計算コストは著しく低減され、C-SCAL+ は連続MDPにおいて UCCRL と同等のレグレットバウンドを達成することが示された。

実験結果

リサーチクエスチョン

  • RQ1高信頼性集合の維持なしに、探索ボーナスを用いて割引なしMDPでサブ線形なレグレットを達成することは可能か?
  • RQ2SCAL や UCCRL のような楽観的アルゴリズムの計算複雑性を、レグレット保証を維持したまま低減できるか?
  • RQ3探索ボーナスを用いて、連続状態の割引なしMDPにおける実装可能なアルゴリズムとしてのレグレット保証を提供することは可能か?
  • RQ4バイアススパンに基づく探索ボーナスは、信頼集合に基づく手法と比較して、レグレットと効率性の面でどのように異なるか?
  • RQ5推定MDPにボーナス項を加えた直接計画法を用いることで、不確実性の面前での楽観主義の原則を、割引なしMDPで効率的に適用できるか?

主な発見

  • SCAL+ は、SCAL と同等のレグレットバウンド—$\widetilde{O}(c\sqrt{\Gamma SAT})$—を達成するが、高信頼性集合の維持を避けることで、計算複雑性を著しく低減している。
  • C-SCAL+ は、連続状態の割引なしMDPにおいて UCCRL と同等のレグレットバウンドを達成し、このような保証を持つ初めての実装可能なアルゴリズムである。
  • SCAL+ の探索ボーナスは、$\widetilde{O}(c / \sqrt{N(s,a)})$ のスケーリングを示し、ここで $c$ は最適バイアス関数のスパンの上界である。
  • 推定MDPにボーナス項を加えた直接計画法により、理論的レグレット保証を維持しつつ、計算を効率化できる。
  • 理論的分析により、両アルゴリズムがエピソードベースの学習と停止時刻を通じて、推定MDPに対する高確率の信頼性を維持していることが確認された。
  • 結果は、探索ボーナスがバンディット的手法と完全なRLアルゴリズムの間のギャップを埋めるために、割引なしMDPへと効果的に拡張可能であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。