[論文レビュー] MOTS: Minimax Optimal Thompson Sampling
本稿では、各アームの履歴的な引き数に基づいてサンプリングインスタンスを適応的にクリッピングする、Thompson sampling の新規変種であるMOTS(Minimax Optimal Thompson Sampling)を提案する。このクリッピング機構を導入することにより、MOTSは多腕バンディット問題において最小最大最適なレグレットバウンド $O(\sqrt{KT})$ を達成し、バンディット文献において長年の未解決問題を解決するとともに、有限時間的および漸近的両領域において従来のThompson samplingの変種を上回る性能を示す。
Thompson sampling is one of the most widely used algorithms for many online decision problems, due to its simplicity in implementation and superior empirical performance over other state-of-the-art methods. Despite its popularity and empirical success, it has remained an open problem whether Thompson sampling can match the minimax lower bound $Ω(\sqrt{KT})$ for $K$-armed bandit problems, where $T$ is the total time horizon. In this paper, we solve this long open problem by proposing a variant of Thompson sampling called MOTS that adaptively clips the sampling instance of the chosen arm at each time step. We prove that this simple variant of Thompson sampling achieves the minimax optimal regret bound $O(\sqrt{KT})$ for finite time horizon $T$, as well as the asymptotic optimal regret bound for Gaussian rewards when $T$ approaches infinity. To our knowledge, MOTS is the first Thompson sampling type algorithm that achieves the minimax optimality for multi-armed bandit problems.
研究の動機と目的
- Thompson sampling が $K$-腕バンディット問題に対して最小最大最適なレグレットバウンド $\Omega(\sqrt{KT})$ を達成できるかどうかという未解決問題を解消すること。
- 一般の報酬分布下で、同時に最小最大最適性と漸近的最適性を達成するThompson sampling の変種を設計すること。
- ガウス事前分布に対する従来の下界が、非ガウス事前分布下では必ずしも成立しないことの証明。
- レグレットバウンドを改善しつつも、単純性や実験的性能を損なわない新しいクリッピングに基づくメカニズムに理論的保証を提供すること。
提案手法
- 各アームの引き回数に基づいてサンプルされた報酬値を適応的にクリッピングするThompson sampling の変種、MOTSを導入する。
- 引き回数の逆平方根に比例するクリッピングしきい値を適用し、サンプリングの分散を制御し、過剰な探索を防ぐ。
- 一般の報酬分布下でのレグレットバウンドを導出するため、サブガウス分布およびレイリー型の尾部バウンドに基づく新しい解析フレームワークを採用する。
- ガウス報酬設定において、クリップド・レイリー分布に従うサンプルを用いるMOTS-$\mathcal{J}$ という変種を採用し、最小最大最適性と漸近的最適性の両方を達成する。
- 確率的集中不等式と $\mathcal{J}$ 分布の尾部確率バウンドを用いて、高確率的領域における期待レグレットを制御する。
- 有限時間および無限時間のレグレットバウンドに分解し、サンプリング確率のギャップを丁寧に取り扱うことで、レグレットバウンドを導出する。
実験結果
リサーチクエスチョン
- RQ1Thompson sampling は、有限時間の多腕バンディット問題において、最小最大最適なレグレットバウンド $O(\sqrt{KT})$ を達成できるように変更可能か?
- RQ2非ガウス事前分布を用いる場合、ガウス事前分布に対する従来の $\Omega(\sqrt{KT\log K})$ 下界は成立しないのか?
- RQ31つのアルゴリズムが多腕バンディット設定において、最小最大最適性と漸近的最適性の両方を達成可能か?
- RQ4適応的クリッピングは、Thompson sampling のサンプリング分布および最終的なレグレットにどのような影響を与えるか?
主な発見
- MOTSは、問題に依存しないレグレットバウンド $O(\sqrt{KT})$ を達成し、$K$-腕バンディット問題の最小最大下界 $\Omega(\sqrt{KT})$ と一致する。
- ガウス報酬の設定では、MOTS-$\mathcal{J}$ 変種が最小最大最適なレグレットと漸近的最適性の両方を達成し、従来の結果を改善する。
- 非ガウス事前分布を用いる一般の場合には、ガウス事前分布に対する $\Omega(\sqrt{KT\log K})$ 下界は成立しない。
- 提案されたクリッピング機構は、サンプリング分散を効果的に制御し、過剰探索を防ぎ、よりタイトなレグレットバウンドを実現する。
- 実験結果では、UCB、MOSS、およびガウス事前分布を用いた標準的Thompson samplingを上回る性能を示す。
- 理論的解析により、クリッピング戦略が有限時間的および漸近的両領域において定数倍のオーダーで最適なレグレットバウンドをもたらすことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。