Skip to main content
QUICK REVIEW

[論文レビュー] Regret Bounds for Discounted MDPs

Shuang Liu, Hao Su|arXiv (Cornell University)|Feb 12, 2020
Advanced Bandit Algorithms Research参考文献 16被引用数 7
ひとこと要約

この論文は、非エピソード的強化学習における性能指標として $γ$-リグレットを導入し、有限時刻における性能をより適切に捉えるために、平均報酬リグレットの限界を克服する。理論的境界を確立し、$γ$-リグレットが $\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ のスケーリングを示すことを示しており、従来の手法よりもきめ細やかで実用的な有限時刻最適性基準を提供する。

ABSTRACT

Reinforcement learning (RL) has traditionally been understood from an episodic perspective; the concept of non-episodic RL, where there is no restart and therefore no reliable recovery, remains elusive. A fundamental question in non-episodic RL is how to measure the performance of a learner and derive algorithms to maximize such performance. Conventional wisdom is to maximize the difference between the average reward received by the learner and the maximal long-term average reward. In this paper, we argue that if the total time budget is relatively limited compared to the complexity of the environment, such comparison may fail to reflect the finite-time optimality of the learner. We propose a family of measures, called $γ$-regret, which we believe to better capture the finite-time optimality. We give motivations and derive lower and upper bounds for such measures. Note: A follow-up work (arXiv:2010.00587) has improved both our lower and upper bound, the gap is now closed at $ ildeΘ\left(\frac{\sqrt{SAT}}{(1 - γ)^{\frac{1}{2}}} ight)$.

研究の動機と目的

  • 時間予算 $T$ が環境の複雑さに比べて小さい際、有限時刻性能を捉えるのに不十分な平均報酬リグレットの欠陥を是正すること。
  • 非エピソード的MDPにおける有限時限最適性をよりよく反映する新たな性能指標として $γ$-リグレットを提案すること。
  • $γ$-リグレットの理論的下界および上界を導出することで、その性能指標としての適切さを検証すること。
  • 限られた時間予算下での短期的性能を重視するRLアルゴリズムの評価および設計のためのフレームワークを提供すること。

提案手法

  • 非エピソード的設定における $γ$-リグレットを、最適な $γ$-割引価値と $T$ ステップ間の累積報酬の差分として定義する:$\textnormal{Regret}_{\gamma}(T) = \sum_{h=0}^{T-1}(1-\gamma)V^{*,\gamma}_{s_h} - \sum_{h=0}^{T-1}r_h$。
  • 非エピソード的価値関数学習における過大評価バイアスと自己依存性を軽減するため、ダブルQラーニングを用いる。
  • リセットが行われない非エピソード的設定におけるリグレットの発散を制御するため、エピソード的RL(例:Jinら、2018年)の証明技術を適応する。
  • 集中不等式と非最適ステップ数の境界を用いて期待リグレットを分析することで、上界を確立する。
  • Jakschら(2010年)の二状態MDP構成を割引設定に適応させることで、下界を導出する。
  • 性能比較のベンチマークとして、$γ$-割引価値関数 $V^{*,\gamma}_s = \sup_\pi \mathbb{E}_\pi[\sum_{h=0}^\infty \gamma^h r_h \mid s_0 = s]$ を用いる。

実験結果

リサーチクエスチョン

  • RQ1時間予算 $T$ が小さい際、有限時刻最適性を反映する非エピソード的RLの性能指標をどのように定義できるか?
  • RQ2複雑な環境で時間予算が限られている際、なぜ平均報酬リグレットでは有限時限性能を十分に捉えられないのか?
  • RQ3提案された $γ$-リグレット指標の理論的下界および上界は何か?
  • RQ4$γ$-リグレットフレームワークは、従来の平均報酬リグレット形式に比べて、より優れたアルゴリズム設計を可能にするか?
  • RQ5非エピソード的設定における割引因子 $\gamma$ の依存性が、リグレット境界にどのように影響するか?

主な発見

  • 本研究では、期待 $γ$-リグレットの理論的上界が $\tilde{O}\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ であることを確立し、これは従来の平均報酬リグレット境界よりもきめ細やかである。
  • 上界は、非最適ステップ数の分析と、ダブルQラーニングおよび適応的学習率を用いたリグレット発散の制御によって導出された。
  • 二状態MDP構成を用いた下界の証明により、標準的仮定下では $γ$-リグレットは $\Omega\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ よりも改善できないことが示された。
  • 後続の研究(Heら、2020年)で上界と下界のギャップが埋められ、$\tilde{\Theta}\left(\frac{\sqrt{SAT}}{(1-\gamma)^{1/2}}\right)$ のタイトな境界であることが確認された。
  • 非最適ステップ数に関する既存の境界($N_{\gamma}(\epsilon,\delta)$)は、一様性仮定が追加されない限り、よりきめ細やかなリグレット境界をもたらさないことが分析で示された。
  • 提案された $γ$-リグレット指標は、$T \ll \text{mixing time}$ の場合に特に顕著な、有限時限学習者と無限時限最適方策の比較の落とし穴を回避する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。