[論文レビュー] Learning Unknown Markov Decision Processes: A Thompson Sampling Approach
本稿では、未知の弱く通信可能なマルコフ決定過程(MDP)を学習するための強化学習アルゴリズムである、動的エピソードを用いたトンプソンサンプリング(TSDE)を提案する。MDPパラメータの事後分布からサンプリングし、状態行動ペアへの訪問回数の倍増(doubling trick)とエピソード長の制御的増加という2つの停止基準を用いることで、TSDEは$\tilde{O}(HS\sqrt{AT})$のベイジアン期待リグレットバウンドを達成し、このクラスのMDPにおける既存の最良理論的性能と一致し、シミュレーションでも既存のアルゴリズムを上回る性能を示した。
We consider the problem of learning an unknown Markov Decision Process (MDP) that is weakly communicating in the infinite horizon setting. We propose a Thompson Sampling-based reinforcement learning algorithm with dynamic episodes (TSDE). At the beginning of each episode, the algorithm generates a sample from the posterior distribution over the unknown model parameters. It then follows the optimal stationary policy for the sampled model for the rest of the episode. The duration of each episode is dynamically determined by two stopping criteria. The first stopping criterion controls the growth rate of episode length. The second stopping criterion happens when the number of visits to any state-action pair is doubled. We establish $ ilde O(HS\sqrt{AT})$ bounds on expected regret under a Bayesian setting, where $S$ and $A$ are the sizes of the state and action spaces, $T$ is time, and $H$ is the bound of the span. This regret bound matches the best available bound for weakly communicating MDPs. Numerical results show it to perform better than existing algorithms for infinite horizon MDPs.
研究の動機と目的
- 特殊な構造的仮定(例:再帰性や既知の再帰状態)がない一般の無限時 horizon MDPに対する理論的裏付けのあるトンプソンサンプリングアルゴリズムの欠如に対処すること。
- 弱く通信可能なMDPにおいて強力なリグレット保証を達成できる動的エピソードスケジューリング機構を設計すること。
- 事後分布のサンプリングと適応的エピソード終了を用いて、探索と活用のバランスを取ること。
- 弱く通信可能なMDPにおける既存の最良理論的性能に一致するリグレットバウンドを確立すること。
提案手法
- アルゴリズムは、未知MDPパラメータに関する現在の信念から、各エピソードの開始時にモデルのサンプルを事後分布から生成する。
- エピソードは、任意の状態行動ペアへの訪問回数が倍増した場合、またはエピソード長が時間に線形的に増加した場合に終了する。
- エピソード長は、成長率基準を用いて動的に制御され、リグレット解析における十分な探索と安定性を保証する。
- エージェントは各エピソードを通じて、サンプルされたMDPにおける最適な定常方策に従う。
- 遷移確率にディリクレ事前分布を用いたベイジアン推論により、事後分布を維持する。
- リグレット解析では、濃度不等式とエピソード回数・スパンのバウンドを組み合わせ、最終的なリグレットバウンドを導出する。
実験結果
リサーチクエスチョン
- RQ1再帰性や既知の再帰状態といった構造的仮定がない一般の無限時 horizon MDPに対して、トンプソンサンプリングを効果的に適用できるか?
- RQ2MDPにおけるトンプソンサンプリングで強力なリグレットバウンドを達成するために必要なエピソード終了基準は何か?
- RQ3成長率制御と訪問回数の倍増を組み合わせた動的エピソード長スケジュールは、リグレット性能の向上に寄与するか?
- RQ4提案されたTSDEアルゴリズムは、類似するリグレット次数を持つ既存のアルゴリズムと比較して、実験的にどのように差をつけるか?
主な発見
- TSDEは$\tilde{O}(HS\sqrt{AT})$のベイジアン期待リグレットバウンドを達成し、弱く通信可能なMDPにおける既存の最良バウンドと一致する。
- リグレットバウンドは対数要因を除いてタイトであり、$T$のオーダーで理論的下界に近づく。
- ランダムに生成されたMDPにおけるシミュレーションでは、TSDEはUCRL2、TSMDP、Lazy PSRLのすべてを期待リグレットの観点で顕著に上回った。
- RiverSwimベンチマークでは、TSDEは、慎重に選択された再サンプリング状態を用いたTSMDPを含むすべてのベースラインを上回り、モデル不確実性に対するロバストネスを示した。
- TSDEとLazy PSRLとの間の性能差は、最初の停止基準(成長率制御)が活用と探索のバランスを取るために重要であることを示している。
- 結果から、TSDEはベイジアンフレームワークに依存しているものの、非ベイジアン設定でも同様のリグレットバウンドを達成できる可能性があると示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。