Skip to main content
QUICK REVIEW

[論文レビュー] Langevin Monte Carlo for Contextual Bandits

Pan Xu, Hongkai Zheng|arXiv (Cornell University)|Jun 22, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿では、ラプラシアン近似の代わりにラングヴィン・モンテカルロ(LMC)を用いたノイズ付き勾配降下法により、計算的に効率的な事後分布サンプリング手法であるLangevin Monte Carlo Thompson Sampling(LMC-TS)を提案する。この手法は、線形文脈的バンディットにおいて、最先端のトマソンサンプリングアルゴリズムと同等の非線形なレグレットバウンドを達成する一方で、共分散行列の逆行列計算やガウス分布の仮定を必要とせず、スケーラブルで高次元な事後分布サンプリングを可能にする。

ABSTRACT

We study the efficiency of Thompson sampling for contextual bandits. Existing Thompson sampling-based algorithms need to construct a Laplace approximation (i.e., a Gaussian distribution) of the posterior distribution, which is inefficient to sample in high dimensional applications for general covariance matrices. Moreover, the Gaussian approximation may not be a good surrogate for the posterior distribution for general reward generating functions. We propose an efficient posterior sampling algorithm, viz., Langevin Monte Carlo Thompson Sampling (LMC-TS), that uses Markov Chain Monte Carlo (MCMC) methods to directly sample from the posterior distribution in contextual bandits. Our method is computationally efficient since it only needs to perform noisy gradient descent updates without constructing the Laplace approximation of the posterior distribution. We prove that the proposed algorithm achieves the same sublinear regret bound as the best Thompson sampling algorithms for a special case of contextual bandits, viz., linear contextual bandits. We conduct experiments on both synthetic data and real-world datasets on different contextual bandit models, which demonstrates that directly sampling from the posterior is both computationally efficient and competitive in performance.

研究の動機と目的

  • 文脈的バンディットにおけるトマソンサンプリングの高次元事後分布サンプリングにおけるラプラシアン近似の計算的非効率性を解消すること。
  • 特に一般化線形バンディットやニューラルバンディットのような非線形報酬モデルにおいて、真の事後分布が非ガウス的である場合に生じるガウス近似の制限を克服すること。
  • 共分散行列の計算が高価であるのを避けるために、MCMCを直接用いて真の事後分布からサンプリングする実用的でスケーラブルなアルゴリズムの開発。
  • 提案手法の理論的レグレットバウンドを確立し、線形文脈的バンディットにおける最高水準の結果と同等のものにすること。
  • 合成データおよび実世界のデータセットを用いた、手法の性能と効率性の経験的妥当性の検証。

提案手法

  • 真の事後分布の近似サンプリングのために、ラングヴィン・モンテカルロ(LMC)を用いてノイズ付き勾配降下更新を実行し、明示的なラプラシアン近似を回避する。
  • 確率的勾配更新ルールを採用:$\theta_{k+1} = \theta_k + \frac{\eta}{2} \nabla \log p(\theta | \mathcal{D}_t) + \sqrt{\eta} \xi_k$、ここで $\xi_k \sim \mathcal{N}(0, I)$。
  • LMCをトマソンサンプリングと統合し、現在のLMCイテレートからサンプリングすることで行動を選択し、不確実性を考慮した探索を可能にする。
  • LMCが弱い条件下でも真の事後分布に収束することを活用し、十分な反復回数で任意の精度を得られることを保証する。
  • アーキテクチャの変更なしに、線形、一般化線形、ニューラル文脈的バンディットモデルにこの手法を適用可能である。
  • 適応的ステップサイズと収束モニタリングを用いて、サンプリングの正確さと計算コストのバランスをとる。

実験結果

リサーチクエスチョン

  • RQ1真の事後分布からのラングヴィン・モンテカルロサンプリングは、レグレットと計算的効率性の両面で、ラプラシアン近似に基づくトマソンサンプリングを上回ることができるか?
  • RQ2ガウス近似に依存せずに、線形文脈的バンディットにおいてLMC-TSが非線形なレグレットを達成できるか?
  • RQ3ラプラシアン近似が計算的に困難になる高次元設定において、LMC-TSはどのように性能を発揮するか?
  • RQ4一般化線形バンディットやニューラルバンディットのような非線形報酬モデルに対しても、LMC-TSは効果的に適用可能か?
  • RQ5提案手法は、多様な合成的および実世界の文脈的バンディット環境においてスケーラブルで頑健であるか?

主な発見

  • LMC-TSは、線形文脈的バンディットにおける最良のトマソンサンプリングアルゴリズムと同等の非線形なレグレットバウンドを達成し、理論的競争力を裏付けた。
  • 一般共分散行列のサンプリングにおける計算的ボトル neck を回避するため、行列の逆行列計算ではなくノイズ付き勾配更新を用いる。
  • 合成データおよび実世界のデータセットを用いた実験により、LMC-TSは計算的に効率的であり、最先端の手法と経験的に同等の性能を発揮することが示された。
  • 問題固有の共分散チューニングを必要とせず、線形、一般化線形、ニューラル文脈的バンディットモデルのすべてで強力な性能を維持した。
  • 理論的分析により、十分な反復回数でサンプリング誤差が減少し、真の事後分布に収束することが確認された。
  • 標準的な仮定の下で、LMC-TSは $O(\sqrt{d \log T})$ のレグレットバウンドを達成し、線形バンディットにおける既知の最適レートと一致した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。