Skip to main content
QUICK REVIEW

[論文レビュー] Minimax Regret for Stochastic Shortest Path

Alon Cohen, Yonathan Efroni|arXiv (Cornell University)|Mar 24, 2021
Advanced Bandit Algorithms Research参考文献 33被引用数 5
ひとこと要約

本稿は、未知のコストを伴う強化学習における確率的最短経路(SSP)のミニマックスレグレットを確立し、有限ホライズンMDPへの新しい還元を提案する。レグレットバウンドは $ frac{1}{2}$ で、既知の下界と一致し、$ frac{1}{2}$ のギャップを排除することで先行研究を改善する。新規アルゴリズムULCVIにより、$B_{ star}$ に対して多項式的依存、ホライズンに対して対数的依存を実現する。

ABSTRACT

We study the Stochastic Shortest Path (SSP) problem in which an agent has to reach a goal state in minimum total expected cost. In the learning formulation of the problem, the agent has no prior knowledge about the costs and dynamics of the model. She repeatedly interacts with the model for $K$ episodes, and has to minimize her regret. In this work we show that the minimax regret for this setting is $\widetilde O(\sqrt{ (B_\star^2 + B_\star) |S| |A| K})$ where $B_\star$ is a bound on the expected cost of the optimal policy from any state, $S$ is the state space, and $A$ is the action space. This matches the $Ω(\sqrt{ B_\star^2 |S| |A| K})$ lower bound of Rosenberg et al. [2020] for $B_\star \ge 1$, and improves their regret bound by a factor of $\sqrt{|S|}$. For $B_\star < 1$ we prove a matching lower bound of $Ω(\sqrt{ B_\star |S| |A| K})$. Our algorithm is based on a novel reduction from SSP to finite-horizon MDPs. To that end, we provide an algorithm for the finite-horizon setting whose leading term in the regret depends polynomially on the expected cost of the optimal policy and only logarithmically on the horizon.

研究の動機と目的

  • 確率的最短経路(SSP)におけるレグレットの上界と下界のギャップを埋める。
  • コストが小さいかゼロの場合、標準的な楽観的アプローチが無限ループを引き起こすという課題に対処する。
  • 最適方策の期待コスト $B_{\tstar}$、状態空間 $|S|$、行動空間 $|A|$、エピソード数 $K$ に対して最適な依存関係を達成する、SSPのレグレット最小化アルゴリズムを開発する。
  • 両ケース $B_{\tstar} \geq 1$ および $B_{\tstar} < 1$ に対して、ミニマックス最適性を示すために下界を確立することで、レグレットバウンドのミニマックス最適性を証明する。

提案手法

  • 各エピソードを長さ $H$ の固定ホライズンに分割する、SSPから有限ホライズンMDPへのブラックボックス還元を提案する。
  • $B_{\tstar}$ に対して多項式的依存、$H$ に対して対数的依存する、有限ホライズンMDPにおける新たなアルゴリズムULCVIを導入する。これは先行手法を改善する。
  • 最適方策の期待到達時間に関する事前知識がなくても、長周期を回避し、ゴール到達性を保証するため、$H$ ステップごとにリスタートするメカニズムを導入する。
  • 有限ホライズン設定におけるレグレットを制御するために、Freedmanの不等式とJensenの不等式を用いた高確率濃度バウンドを適用する。
  • i.i.d.コストを伴う難易度の高いMDPインスタンスを構築し、$B_{\tstar} < 1$ の場合に $ frac{1}{2}$ の下界 $ frac{1}{2}$ を、$B_{\tstar} \geq 1$ の場合に $ frac{1}{2}$ の下界 $ frac{1}{2}$ を導出する。
  • 有限ホライズンアルゴリズムと還元を組み合わせることで、SSPにおけるミニマックス最適なレグレットバウンドを達成する。

実験結果

リサーチクエスチョン

  • RQ1コストがi.i.d.かつ初期に未知である場合、確率的最短経路におけるミニマックスレグレットは何か?
  • RQ2先行研究と比較して、状態空間サイズ $|S|$ への依存を軽減することで、レグレットバウンドを改善できるか?
  • RQ3レグレットバウンド $ frac{1}{2}$ は、すべての $B_{\tstar}$ の値に対してミニマックス最適か?
  • RQ4ホライズン $H$ に対して対数的依存、$B_{\tstar}$ に対して多項式的依存する有限ホライズンMDPアルゴリズムを設計できるか?
  • RQ5有限ホライズンMDPへの還元が、ゴール到達性を保ちつつ、レグレットを最小化するか?

主な発見

  • 未知のi.i.d.コストを伴うSSPのミニマックスレグレットは $ frac{1}{2}$ であり、対数的要因を除いて既知の下界と一致する。
  • $B_{\tstar} \geq 1$ の場合、レグレットバウンド $ frac{1}{2}$ はRosenbergら(2020)の $ frac{1}{2}$ の下界と一致し、$ frac{1}{2}$ のギャップが解消される。
  • $B_{\tstar} < 1$ の場合、よりタイトな下界 $ frac{1}{2}$ を証明し、この領域でも上界がミニマックス最適であることを示す。
  • 提案されたULCVIアルゴリズムは、有限ホライズンMDPにおいて $B_{\tstar}$ に対して多項式的依存、ホライズン $H$ に対して対数的依存するレグレットを達成し、$\sqrt{H}$ 依存の先行手法を改善する。
  • SSPから有限ホライズンMDPへの還元は、最適方策の期待到達時間に関する事前知識がなくても、各エピソードにおけるゴール到達性を保証する。
  • 解析により、正しく測るべきレグレットの尺度はホライズン長 $H$ ではなく、最適方策の期待コスト $B_{\tstar}$ であることが示され、$B_{\tstar}$ が主要な複雑さパラメータであることが裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。