[論文レビュー] Scalable Thompson Sampling via Optimal Transport
本稿では、明示的な分布仮定を必要とせず、粒子ベースの後方分布近似を最適化するために Wasserstein 勾配フローを用いるスケーラブルな Thompson sampling フレームワーク π-TS を提案する。後方推論を確率測度上の凸最適化問題として定式化することにより、π-TS はニューラルネットワークなどの複雑なモデルを用いた大規模な文脈的バンディット問題において、不確実性推定と性能の両面で優れた結果を達成し、変分ベイズや線形モデルを含むベースラインを合成および実世界のデータセットの両方で上回る。
Thompson sampling (TS) is a class of algorithms for sequential decision-making, which requires maintaining a posterior distribution over a model. However, calculating exact posterior distributions is intractable for all but the simplest models. Consequently, efficient computation of an approximate posterior distribution is a crucial problem for scalable TS with complex models, such as neural networks. In this paper, we use distribution optimization techniques to approximate the posterior distribution, solved via Wasserstein gradient flows. Based on the framework, a principled particle-optimization algorithm is developed for TS to approximate the posterior efficiently. Our approach is scalable and does not make explicit distribution assumptions on posterior approximations. Extensive experiments on both synthetic data and real large-scale data demonstrate the superior performance of the proposed methods.
研究の動機と目的
- 正確な推論が困難であるため、ニューラルネットワークなどの複雑なモデルにおける Thompson sampling におけるスケーラブルな後方分布近似の課題に対処すること。
- 従来の粒子ベース手法が粒子を独立して扱うという制限を克服し、粒子間の相互作用を導入することで、後方分布近似の質を向上させること。
- 後方分布の特定のパラメトリックな形を仮定しない、効率的で原理的根拠のある後方分布近似フレームワークの開発。
- 大規模な実世界データセットおよび動的意思決定シナリオにおいて、提案手法の有効性を示すこと。
- Wasserstein 勾配フローを用いた理論的根拠に基づく後方分布サンプリングにより、分布近似の最適性を保証すること。
提案手法
- Wasserstein 勾配フロー(WGF)を用いて、Thompson sampling における後方分布近似を確率測度の空間上での凸最適化問題として定式化する。
- Wasserstein 多様体上の離散勾配フローに従って進化する粒子の集合を用いて、後方分布を近似する。
- 更新ルールにカーネルに基づく相互作用項を導入することで、粒子間の相互作用を実装し、後方分布近似の集団的改善を可能にする。
- 粒子間の距離とカーネル関数に基づくペアワイズ相互作用を組み込んだ粒子更新ルール(式5)を導出する。
- 粒子ダイナミクスの安定化と崩壊・退化の防止を目的に、拡散に基づく正則化項を用いる。
- 1ステップの意思決定ごとに1つの粒子をサンプリングすることで、粒子相互作用に基づく後方分布近似を Thompson sampling に統合し、不確実性に配慮したサンプリングによる探索を保証する。
実験結果
リサーチクエスチョン
- RQ1Wasserstein 勾配フローを用いた粒子相互作用最適化は、独立した粒子手法と比較して、Thompson sampling における後方分布近似を改善できるか?
- RQ2提案された π-TS フレームワークは、大規模な文脈的バンディット問題において、VI-TS や Neural-Linear、Lin-TS などの既存ベースラインを上回るレジット性能を達成できるか?
- RQ3高次元または非 i.i.d. 観測設定下において、π-TS は不確実性のキャリブレーションを維持し、レジット分散を低減できるか?
- RQ4報酬構造が複雑な実世界データセットにおいて、表現能力が限られたモデルや不確実性推定が不十分なモデルと比較して、π-TS はどのように性能を発揮するか?
- RQ5後方分布に明示的な分布仮定を必要とせずに、WGF ベースのフレームワークは、深層ニューラルネットワークなどの複雑なモデルに適用可能か?
主な発見
- π-TS-DGF は、線形およびスパース線形バンディット設定において、Lin-TS(正確な後方分布)にほぼ匹敵するレジット性能を達成し、Neural-Linear や VI-TS よりも顕著に優れている。
- Statlog, Covertype, Adult, Census, Financial, Mushroom などの実世界データセットにおいて、π-TS はすべての設定で最小の正規化累積レジットを達成し、特に大規模なデータセットでは一貫した性能向上を示している。
- VI-TS は不確実性の低減推定により高いレジット分散と劣った性能を示す一方、π-TS は粒子間相互作用のおかげでより良い不確実性キャリブレーションを維持している。
- より多くのデータが与えられるにつれて、π-TS と Lin-TS の性能差が縮小するため、π-TS が Lin-TS がモデル化できない複雑な後方分布構造を効果的に捉えていることが示唆される。
- Neural-Linear は特徴表現の向上により Lin-TS よりも優れているが、依然として π-TS に劣り、特にニューラル特徴が最適でない場合に顕著である。
- π-TS における粒子相互作用メカニズムにより、すべての評価シナリオでより安定的かつ正確な後方分布近似が達成されており、レジットと分散の両面で低い値が得られている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。