Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Stochastic Shortest Path.

Aviv Rosenberg, Yishay Mansour|arXiv (Cornell University)|Jun 20, 2020
Advanced Bandit Algorithms Research参考文献 5被引用数 9
ひとこと要約

本稿は、動的遷移が固定されかつ未知のままながら、エピソード間でコストが任意に変化する敵対的確率的最短経路(SSP)問題を導入する。すべてのコストが正である場合、$\tilde{O}(\pi K)$ のレグレットを達成するアルゴリズムを提案し、一般の場合には $\tilde{O}(K^{3/4})$ を達成する。これは、未知の動的遷移を伴う敵対的SSPに対して、初めての非線形レグレットバウンドをもたらす。

ABSTRACT

Stochastic shortest path (SSP) is a well-known problem in planning and control, in which an agent has to reach a goal state in minimum total expected cost. In this paper we consider adversarial SSPs that also account for adversarial changes in the costs over time, while the dynamics (i.e., transition function) remains unchanged. Formally, an agent interacts with an SSP environment for $K$ episodes, the cost function changes arbitrarily between episodes, and the fixed dynamics are unknown to the agent. We give high probability regret bounds of $\widetilde O (\sqrt{K})$ assuming all costs are strictly positive, and $\widetilde O (K^{3/4})$ for the general case. To the best of our knowledge, we are the first to consider this natural setting of adversarial SSP and obtain sub-linear regret for it.

研究の動機と目的

  • コストがエピソード間で任意に変化する敵対的確率的最短経路問題を形式化し、研究すること。
  • 敵対的コストの変化下で動的遷移が未知であるSSPにおける挑戦に取り組むこと。
  • この敵対的SSP設定における学習の高確率的レグレットバウンドを導出すること。
  • 遷移動的遷移に関する事前知識が欠如している状況でも、非線形レグレット保証を確立すること。

提案手法

  • エージェントは $K$ エピソードにわたりSSP環境と相互作用し、エピソード間で任意のコスト関数が変化する状況に直面する。
  • すべてのコストが正であると仮定することで、より緊密なレグレットバウンドを達成できる。
  • 敵対的コスト系列に適応したバリエーションの価値反復または動的計画法を活用する。
  • 累積レグレットを最小限に抑える一方で、未知の動的遷移を学習するための探索戦略を組み込む。
  • 集中不等式と推定誤差の高確率的バウンドを用いて、レグレット解析を実施する。
  • 理論的解析により、正のコストの場合に $\tilde{O}(\pi K)$ のレグレット、一般の場合に $\tilde{O}(K^{3/4})$ のレグレットを導出する。

実験結果

リサーチクエスチョン

  • RQ1敵対的コスト変化と未知の動的遷移を伴う確率的最短経路問題において、非線形レグレットを達成できるか?
  • RQ2すべてのコストが正である条件下で、敵対的SSPにおいて最適なレグレットバウンドは何か?
  • RQ3コストが正で制限されない場合、レグレットはどのようにスケーリングするか?
  • RQ4動的遷移に関する事前知識が欠如している状況で、敵対的コストシフト下での学習を可能にするアルゴリズム的手法は何か?
  • RQ5完全なモデル情報が欠如している状況で、敵対的SSPに対して高確率的レグレットバウンドを確立できるか?

主な発見

  • すべてのコストが正である場合、高確率的レグレットバウンドとして $\widetilde{O}(\sqrt{K})$ を達成する。
  • 正の制約がない一般の場合、レグレットバウンドは $\widetilde{O}(K^{3/4})$ である。
  • これらは、敵対的確率的最短経路問題に対して、初めての非線形レグレットバウンドである。
  • 遷移動的遷移が固定されているがエージェントが未知であるという仮定の下で成り立つ。
  • 環境および学習プロセスの確率的要素に対して、高い確率で成立する理論的保証を確立する。
  • 敵対的コストシフト下でのSSPにおけるオンライン学習の基盤となるフレームワークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。