Skip to main content
QUICK REVIEW

[論文レビュー] Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case

Liyu Chen, Haipeng Luo|arXiv (Cornell University)|Feb 10, 2021
Advanced Bandit Algorithms Research参考文献 19被引用数 5
ひとこと要約

本稿では、敵対的コストと未知の遷移ダイナミクスの下での確率的最短経路問題に対する新しいアルゴリズムを提示する。完全情報設定では $\tilde{\mathcal{O}}(\sqrt{S^{2}ADT_{\star}K})$ のレグレットを達成し、バンディットフィードバック設定では $\tilde{\mathcal{O}}(\sqrt{S^{3}A^{2}DT_{\star}K})$ を達成する。遷移推定バイアスを制御するために歪んだ占有測度と楽観的コスト推定器を導入し、先行研究を著しく上回り、バンディットフィードバック、敵対的コスト、未知の遷移という最も困難な組み合わせに対する最初の解決策を提供する。

ABSTRACT

We make significant progress toward the stochastic shortest path problem with adversarial costs and unknown transition. Specifically, we develop algorithms that achieve $\widetilde{O}(\sqrt{S^2ADT_\star K})$ regret for the full-information setting and $\widetilde{O}(\sqrt{S^3A^2DT_\star K})$ regret for the bandit feedback setting, where $D$ is the diameter, $T_\star$ is the expected hitting time of the optimal policy, $S$ is the number of states, $A$ is the number of actions, and $K$ is the number of episodes. Our work strictly improves (Rosenberg and Mansour, 2020) in the full information setting, extends (Chen et al., 2020) from known transition to unknown transition, and is also the first to consider the most challenging combination: bandit feedback with adversarial costs and unknown transition. To remedy the gap between our upper bounds and the current best lower bounds constructed via a stochastically oblivious adversary, we also propose algorithms with near-optimal regret for this special case.

研究の動機と目的

  • 敵対的コストと未知の遷移関数を伴う確率的最短経路(SSP)問題に対処すること。先行研究では、遷移が既知であるか、簡素なフィードバック設定を仮定していた。
  • 敵対的コストと未知の遷移を伴うSSPにおける既存の上界と下界のレグレットのギャップを埋めること。
  • 最適方策の到達時間 $T_{\star}$ の事前知識を必要とせず、完全情報およびバンディットフィードバック設定の両方でサブ線形レグレットを達成する効率的なアルゴリズムを開発すること。
  • 既知の遷移設定に関する先行研究を、より現実的で挑戦的な未知のダイナミクスのケース、特にバンディットフィードバック環境に拡張すること。

提案手法

  • Chenら(2020)のループフリー還元技術を未知の遷移設定に適応し、不確実性下でのレグレット解析を可能にする。
  • 完全情報設定における遷移推定誤差がもたらすバイアスを制御するために、歪んだ占有測度を導入する。
  • ベルマン型の全分散の法則を用いて、コストの分散を期待される到達時間 $T_{\star}$ に関連付け、より緊密なレグレット境界を可能にする。
  • 上位占有測度にインspiredされた2つの楽観的コスト推定器を提案し、バンディットフィードバックの処理とレグレットの最小化に不可欠である。
  • ループフリー還元を拡張して、高速な方策への動的スイッチングを可能とし、確率的おとりの敵対者下でのニアオプティマルレグレットを達成する上で不可欠である。
  • マーティングドリフトを制御し、高確率でのレグレット保証を確保するために、集中不等式(例:フレドマンの不等式およびベイズティプの不等式)を適用する。

実験結果

リサーチクエスチョン

  • RQ1コストが敵対的であり、遷移関数が未知である場合に、確率的最短経路問題で低いレグレットを達成できるか?
  • RQ2未知の遷移下で、状態数 $S$、行動数 $A$、直径 $D$、および期待到達時間 $T_{\star}$ とレグレットのスケーリング関係はどうなるか?
  • RQ3敵対的コストと未知の遷移を伴うバンディットフィードバックアルゴリズムを設計し、サブ線形レグレットを達成できるか?
  • RQ4最も困難な設定、すなわちバンディットフィードバック、敵対的コスト、未知の遷移における上界と下界のギャップを埋められるか?
  • RQ5確率的おとりの敵対者下でニアオプティマルレグレットを達成するために、どのような変更が必要か?(下界がタイトであることが知られている。)

主な発見

  • 提案されたアルゴリズムは、完全情報設定で $\tilde{\mathcal{O}}(\sqrt{S^{2}ADT_{\star}K})$ のレグレットを達成し、RosenbergとMansour(2020)による先行境界 $\tilde{\mathcal{O}}(\frac{1}{c_{\min}}\sqrt{S^{2}AD^{2}K})$ を改善する。
  • バンディットフィードバック設定では、$\tilde{\mathcal{O}}(\sqrt{S^{3}A^{2}DT_{\star}K})$ のレグレットを達成する最初のアルゴリズムが開発され、敵対的コストと未知の遷移、部分的フィードバックの下での未解決問題を解消する。
  • $c_{\min} = 0$ の場合、$\tilde{\mathcal{O}}(K^{2/3})$ のレグレットを達成し、RosenbergとMansour(2020)の $\tilde{\mathcal{O}}(K^{3/4})$ の境界を改善する。
  • 確率的おとりの敵対者下では、アルゴリズムは下界の $\sqrt{S}$ 要因以内のレグレットを達成し、このクラスの敵対者において、現時点で知られている最小のギャップである。
  • $T_{\star}$ や $T_{\max}$ が未知であってもロバストであり、エピソード数と問題パラメータに応じて、レグレット境界が自動的に異なるレジームに切り替わる。
  • 理論的解析により、フレドマンの不等式およびいつでも使えるベイズティプの不等式を含む高度な集中不等式を用いて、高確率でのレグレット保証が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。