[論文レビュー] Parallelizing Thompson Sampling
本稿では、動的バッチ機構を用いることで、TからO(log T)に減少する逐次的相互作用を実現しながら、確率的マルチアームバンディットおよび線形コンテキストバンディット問題において漸近的に最適なリグレットを達成するバッチ版トムソンサンプリングフレームワークを提案する。バッチ期間をオフラインのリグレット推定に基づいて適応的に決定することにより、O(N log T)のバッチ数でほぼ最適な性能を維持する。実験では、静的バッチポリシーに比べて顕著に優れた性能を示した。
How can we make use of information parallelism in online decision making problems while efficiently balancing the exploration-exploitation trade-off? In this paper, we introduce a batch Thompson Sampling framework for two canonical online decision making problems, namely, stochastic multi-arm bandit and linear contextual bandit with finitely many arms. Over a time horizon $T$, our extit{batch} Thompson Sampling policy achieves the same (asymptotic) regret bound of a fully sequential one while carrying out only $O(\log T)$ batch queries. To achieve this exponential reduction, i.e., reducing the number of interactions from $T$ to $O(\log T)$, our batch policy dynamically determines the duration of each batch in order to balance the exploration-exploitation trade-off. We also demonstrate experimentally that dynamic batch allocation dramatically outperforms natural baselines such as static batch allocations.
研究の動機と目的
- 並列情報アクセスの下でのオンライン意思決定における探索と活用のバランスをとる課題に対処すること。
- 確率的バンディット問題において、逐次的相互作用の数をTからO(log T)に削減しながら、漸近的リグレット最適性を維持すること。
- 探索と活用のバランスをとるために、バッチ期間を適応的に設定する動的バッチメカニズムを開発すること。
- 実験的に、動的バッチ割り当てが静的バッチベースラインに比べてリグレット性能で優れていることを示すこと。
- 理論的リグレット保証を伴う、マルチアームおよび線形コンテキストバンディット設定の両方へフレームワークを拡張すること。
提案手法
- N本の腕を持つ確率的マルチアームバンディットに対して、O(N log T)のバッチ数と問題依存の最適リグレットを達成するバッチ版トムソンサンプリング(B-TS)を提案する。
- O(N log T)のバッチ数でミニマックスリグレット最適性を達成するバッチ最小最大最適トムソンサンプリング(B-MOTS)を導入し、境界の改善に寄与するガウス事前分布を用いる。
- d次元の特徴を持つ線形バンディットに対して、O(N log T)のバッチ数でÕ(d^{3/2}√T)のリグレットを達成するコンテキストバンディット用バッチ版トムソンサンプリング(B-TS-C)を開発する。
- 各バッチの期間を決定するために、オフラインでのリグレット蓄積を推定する動的バッチ機構を採用し、リグレットを最小化すると同時に相互作用頻度を低減する。
- フィルトレーションF_{B(t)}を用いたスーパーマルティンゲールフレームワークを用いてリグレットをバインドし、イベントインジケータと集中不等式を統合する。
- アズマ=フーディング不等式およびチュウら[2011]による固有値に基づく境界を用い、サンプリング分散の和を制御し、高確率でのリグレット境界を保証する。
実験結果
リサーチクエスチョン
- RQ1トムソンサンプリングを並列化することで、逐次的相互作用を減らしつつ、漸近的リグレット最適性を維持できるか?
- RQ2バッチサイズとバッチ頻度をどのように動的に調整すれば、バッチ化されたバンディット設定における探索と活用のバランスを取れるか?
- RQ3確率的バンディット問題で近似的に最適なリグレットを達成するために必要な最小バッチ数は何か?
- RQ4動的バッチ割り当ては、静的バッチポリシーに比べてリグレット性能で優れているか?
- RQ5マルチアームおよびコンテキストバンディット設定の両方において、バッチ化・並列実行下でもトムソンサンプリングの理論的リグレット境界を保てるか?
主な発見
- 提案されたバッチ版トムソンサンプリングフレームワークは、完全に逐次的なトムソンサンプリングと同等の漸近的リグレットバインドを達成し、TではなくO(log T)のバッチ数で実現する。
- 確率的マルチアームバンディットでは、B-TSはベータ事前分布を用いることで問題依存リグレットO(log T)、問題独立リグレットO(√(NT log T))を達成し、ガウス事前分布を用いることでO(√(NT log N))に改善する。
- B-MOTSはO(N log T)のバッチ数でミニマックス最適リグレットバインドO(√(NT))を達成し、B-MOTS-Jはガウス報酬下でミニマックスおよび漸近的最適性を両方満たす。
- 線形コンテキストバンディットでは、B-TS-CはO(N log T)のバッチ数でÕ(d^{3/2}√T)のリグレットを達成し、逐次設定下の最先端性能と一致する。
- 実験結果では、同じバッチ数でも動的バッチ割り当てが静的バッチポリシーに比べて顕著にリグレットを低減することが示された。
- オフラインリグレット推定に基づく動的バッチ機構により、相互作用回数がTからO(log T)に指数的減少し、リグレット性能を損なわず実現可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。