Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Bias-Span-Constrained Exploration-Exploitation in Reinforcement Learning

Ronan Fruit, Matteo Pirotta|arXiv (Cornell University)|Feb 12, 2018
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

この論文は、最適価値関数のバイアススパンのバイアスを利用する弱い通信性MDPにおけるより良いレグレットバウンドを達成する、計算的に効率的な強化学習アルゴリズムSCALを紹介する。既知の最適バイアススパンの上界 $ c $ を用いて探索を制約することにより、SCALは $ \widetilde{O}(c\sqrt{\Gamma SAT}) $ のレグレットバウンドを達成し、直径に依存するUCRLなどのアルゴリズムと比べて、直径が大きくてもバイアススパンが小さいMDPでは顕著に優れている。

ABSTRACT

We introduce SCAL, an algorithm designed to perform efficient exploration-exploitation in any unknown weakly-communicating Markov decision process (MDP) for which an upper bound $c$ on the span of the optimal bias function is known. For an MDP with $S$ states, $A$ actions and $Γ\leq S$ possible next states, we prove a regret bound of $\widetilde{O}(c\sqrt{ΓSAT})$, which significantly improves over existing algorithms (e.g., UCRL and PSRL), whose regret scales linearly with the MDP diameter $D$. In fact, the optimal bias span is finite and often much smaller than $D$ (e.g., $D=\infty$ in non-communicating MDPs). A similar result was originally derived by Bartlett and Tewari (2009) for REGAL.C, for which no tractable algorithm is available. In this paper, we relax the optimization problem at the core of REGAL.C, we carefully analyze its properties, and we provide the first computationally efficient algorithm to solve it. Finally, we report numerical simulations supporting our theoretical findings and showing how SCAL significantly outperforms UCRL in MDPs with large diameter and small span.

研究の動機と目的

  • MDPの直径 $ D $ に比例する既存のRLアルゴリズムの制限を是正すること。これは、実際のレグレットが最適価値関数のバイアススパンによって支配されている場合でも、$ D $ が任意に大きくなる可能性があるためである。
  • 理論的に最適だが実用的でないRegal.Cの制約付き最適化問題を緩和することで、計算的に実行可能となる形にすること。
  • バイアススパン制約付き最適化問題を解くための新規で効率的なアルゴリズム(ScOpt)を開発し、バイアススパンに依存する探索の実装を可能にすること。
  • ScOptをUCRLに類似したフレームワークに統合し、SCALを構築する。これは、直径 $ D $ ではなくバイアススパン $ c $ に依存するレグレットスケーリングを持つ完全に計算可能なアルゴリズムである。
  • Knight Quest環境のような直径が大きくてもバイアススパンが小さいMDPにおいて、UCRLよりもSCALが優れていることを実験的に示すこと。

提案手法

  • Regal.Cにおける計算不能な正則化を置き換えるために、最適バイアス関数 $ h^* $ のスパンの上界 $ c $ を用いた制約付き最適化問題を提案する。
  • 弱い条件下でも収束保証を持つ、バイアススパン制約付き最適化問題を解く計算的に効率的なアルゴリズムScOptを設計する。
  • ScOptの停止基準を導入し、$ \varepsilon $-最適方策を達成することで、実用的応用を保証する。
  • ScOptをUCRL風の探索・活用フレームワークに統合し、バイアススパン制約付きの価値関数の楽観主義を用いて探索を誘導する。
  • 報酬および遷移モデルのベルンシュタイン型信頼区間を用いて楽観的MDPを構築し、$ r_{\max} $ で切り捨てることで安定性を確保する。
  • 非通信性または弱い通信性MDPにおいても、収束条件が常に満たされるように、修正された楽観的議論を適用する。

実験結果

リサーチクエスチョン

  • RQ1弱い通信性MDPにおいて、MDPの直径 $ D $ ではなくバイアススパン $ c $ に依存するレグレットスケーリングを達成する計算的に効率的なアルゴリズムを設計することは可能か?
  • RQ2Regal.Cの最適化問題を緩和することで、計算可能となるが理論的レグレットバウンドを保持できるか?
  • RQ3直径が大きくてもスパンが小さいMDPにおいて、バイアススパン制約は探索効率をどのように向上させるか?
  • RQ4直径が大きくても最適方策が単純な環境において、提案されたアルゴリズムはUCRLのような標準的なOFUベースの手法を上回ることができるか?
  • RQ5探索における環境の複雑さの代理としてバイアススパンを使用する場合、実用的意味は何か?

主な発見

  • SCALは $ \widetilde{O}(c\sqrt{\Gamma SAT}) $ のレグレットバウンドを達成し、MDPの直径 $ D $ に依存しない。これは、$ D $ に依存するUCRL や PSRL より顕著に優れている。
  • Knight Quest環境では、SCALはUCRLを大きく上回り、累積レグレットが非線形に増加し、明確な線形および対数的領域を示している。
  • Knight Questにおける最適方策のバイアススパンは約 $ 3.28 $ であり、直径は約 $ 250 $ であるため、$ D $ と $ c $ の間には大きな開きがある。SCALはこのギャップを効果的に活用している。
  • SCALのレグレット曲線には最小限の平方根的領域しかなく、遠くの高スパン状態が最適方策に寄与しないことが判明すると、急速に収束することが示された。
  • 数値シミュレーションにより、SCALは小さなバイアススパンを活用して、UCRLが高スパン状態に誤って誘導されるのを避けることが確認された。
  • ScOptによる $ \varepsilon $-最適方策の計算により、複雑で弱い通信性のある環境でも、アルゴリズムは効率的かつ安定したままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。