[論文レビュー] Online Learning for Stochastic Shortest Path Model via Posterior Sampling
本稿では、未知の遷移ダイナミクスを有する確率的最短路問題(SSP)のための、後方確率に基づく強化学習アルゴリズムPSRL-SSPを提案する。このアルゴリズムはエポックベースの探索を採用し、各エポックの開始時に事後分布からモデルをサンプリングし、そのサンプルに対する最適方策に従う。これにより、$\tilde{\mathcal{O}}(B_{\star}S\sqrt{AK})$ のベイズ的リグレットバウンドを達成し、これは近似的に最適であり、楽観的アプローチを上回る数値的性能を示す。
We consider the problem of online reinforcement learning for the Stochastic Shortest Path (SSP) problem modeled as an unknown MDP with an absorbing state. We propose PSRL-SSP, a simple posterior sampling-based reinforcement learning algorithm for the SSP problem. The algorithm operates in epochs. At the beginning of each epoch, a sample is drawn from the posterior distribution on the unknown model dynamics, and the optimal policy with respect to the drawn sample is followed during that epoch. An epoch completes if either the number of visits to the goal state in the current epoch exceeds that of the previous epoch, or the number of visits to any of the state-action pairs is doubled. We establish a Bayesian regret bound of $O(B_\star S\sqrt{AK})$, where $B_\star$ is an upper bound on the expected cost of the optimal policy, $S$ is the size of the state space, $A$ is the size of the action space, and $K$ is the number of episodes. The algorithm only requires the knowledge of the prior distribution, and has no hyper-parameters to tune. It is the first such posterior sampling algorithm and outperforms numerically previously proposed optimism-based algorithms.
研究の動機と目的
- 未知の遷移カーネルを有する確率的最短路問題(SSP)のための、後方確率に基づく強化学習アルゴリズムの開発。
- エピソード長が非有界で固定されていないSSPにおいて、効果的な探索エポックを設計する課題の解決。
- 近似的に最適なベイズ的リグレットバウンドを達成するとともに、楽観的アルゴリズムと比較して優れた数値的性能を実現すること。
- ハイパーパrameterのチューニングを必要とせず、事前分布を通じて事前知識を活用する手法の提供。
提案手法
- アルゴリズムはエポックを単位として動作し、現在のエポックにおけるエピソード数が前回のエポックを上回った場合、または任意の状態行動ペアの訪問回数が2倍になった場合に新しいエポックに移行する。
- 各エポックの開始時に、未知のモデルダイナミクスに関する事後分布から遷移カーネルをサンプリングする。
- エージェントは、そのエポックの間、サンプルされたモデルに対する最適方策に従う。
- 有限の期待エピソード長を保証し、リグレット解析を可能にするために、$c_{\epsilon}(s,a) = \max\{c(s,a), \epsilon\}$ の形をした摂動コスト関数を用いる。ここで $\epsilon = (S^2A/K)^{2/3}$ である。
- リグレット解析は、最適方策からの累積コストの期待値のずれを抑え、集中不等式と後方確率の性質を活用することで行われる。
- リグレットバウンドは、モデルのサンプリング誤差、エピソード長、摂動コストの影響に関するバウンドを組み合わせることで導出され、最終的に $\tilde{\mathcal{O}}(B_{\star}S\sqrt{AK})$ のバウンドが得られる。
実験結果
リサーチクエスチョン
- RQ1非有界なエピソード長を有する確率的最短路(SSP)設定において、後方確率が効果的に適応可能か?
- RQ2固定されたエピソードホライズンがないSSPにおいて、効果的な探索と方策切り替えを可能にするエポック終了基準は何か?
- RQ3SSPのための後方確率アルゴリズムは、実用的に楽観的アプローチを上回る近似的に最適なリグレットを達成できるか?
- RQ4ハイパーパrameterのチューニングを必要とせず、事前知識を事前分布を通じて組み込む方法は何か?
主な発見
- PSRL-SSPアルゴリズムは、$\tilde{\mathcal{O}}(B_{\star}S\sqrt{AK})$ のベイズ的リグレットバウンドを達成する。ここで $B_{\star}$ は最適方策の期待コストの上界、$S$ は状態空間のサイズ、$A$ は行動空間のサイズ、$K$ はエピソード数を表す。
- このアルゴリズムはハイパーパrameterのチューニングを一切必要とせず、遷移カーネルに関する事前分布の知識のみを必要とする。
- 数値実験の結果、PSRL-SSPは累積コストと学習効率の面で、以前に提案された楽観的アプローチのアルゴリズムを上回っていることが示された。
- リグレットバウンドは、ミニマックス下界の $\sqrt{S}$ 要因の範囲内にあり、これはSSPにおける後方確率の既知のギャップと整合的である。
- 特に $\epsilon = (S^2A/K)^{2/3}$ を用いた摂動コスト関数の導入により、期待エピソード長が有限であることが保証され、$T_{\star}$(最適方策におけるゴール到達の期待時間)を含む追加の項を含む、洗練されたリグレット解析が可能になった。
- 解析により、エピソード数の期待値が有限であることが示され、$K$ 個のエピソードが最終的に終了することが保証された。これにより、リグレットバウンドの適用可能性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。