Skip to main content
QUICK REVIEW

[論文レビュー] PG-TS: Improved Thompson Sampling for Logistic Contextual Bandits

Bianca Dumitrascu, Karen Feng|arXiv (Cornell University)|May 18, 2018
Advanced Bandit Algorithms Research参考文献 29被引用数 11
ひとこと要約

本稿では、Pólya-Gamma補完を用いて効率的な完全ベイズ的後方推論を可能にする、ロジスティックコンテキストバンディットのための新規Thompson SamplingアルゴリズムPG-TSを提案する。Pólya-Gamma潜在変数を用いたギブスサンプラーを採用することで、Laplace-TS や GLM-UCB と比較して、特に探索と活用のバランスや収束速度において優れた経験的性能を達成しつつ、計算効率を維持している。

ABSTRACT

We address the problem of regret minimization in logistic contextual bandits, where a learner decides among sequential actions or arms given their respective contexts to maximize binary rewards. Using a fast inference procedure with Polya-Gamma distributed augmentation variables, we propose an improved version of Thompson Sampling, a Bayesian formulation of contextual bandits with near-optimal performance. Our approach, Polya-Gamma augmented Thompson Sampling (PG-TS), achieves state-of-the-art performance on simulated and real data. PG-TS explores the action space efficiently and exploits high-reward arms, quickly converging to solutions of low regret. Its explicit estimation of the posterior distribution of the context feature covariance leads to substantial empirical gains over approximate approaches. PG-TS is the first approach to demonstrate the benefits of Polya-Gamma augmentation in bandits and to propose an efficient Gibbs sampler for approximating the analytically unsolvable integral of logistic contextual bandits.

研究の動機と目的

  • 高次元または非ガウス的コンテキスト下で、標準的なベイズ的手法(例:ラプラス近似)が失敗するロジスティックコンテキストバンディットにおける後方推論の不確実性という課題に対処すること。
  • モデルパラメータおよびコンテキスト特徴量の共分散の正確な後方推定を可能にする完全ベイズ的アプローチを開発し、探索と活用のトレードオフを改善すること。
  • Pólya-Gamma補完をバンディットアルゴリズムに初めて適用することにより、解析的に不確実な後方分布に対する効率的なMCMCサンプリングを可能にすること。
  • PG-TSを合成データおよび実世界のデータ(ニュース推薦およびフォレストカバータイプ予測)に対して評価し、その経験的優位性を検証すること。

提案手法

  • Pólya-Gamma補完を導入し、扱いにくいロジスティック尤度を条件付き共役な形に変換することで、効率的なギブスサンプリングを可能にする。
  • モデルパラメータおよびPólya-Gamma潜在変数の後方分布から逐次的にサンプリングするギブスサンプラーを採用し、条件付き共役性を活用する。
  • コンテキスト特徴量の後方共分散を明示的に推定することで、特徴量の依存関係を捉え、Laplace-TSが独立性を仮定するのとは異なり、探索を向上させる。
  • リアルタイム学習の制約に適合させるためにバッチ更新を採用し、低コストの計算負荷を維持する。
  • シミュレーション環境および実世界のデータセット(Yahoo! Today Moduleおよびフォレストカバータイプ)に対して適用し、偏りのないオフライン評価を実施する。
  • 低遅延デプロイメントを想定したストリーミング版PG-TS-streamを提案し、最小限の計算コストで性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1Pólya-Gamma補完は、ロジスティックコンテキストバンディットにおける後方サンプリングの改善に効果的に活用できるか?
  • RQ2コンテキスト特徴量の共分散を明示的に推定することで、ラプラス近似と比較してより良い探索と低いリグレットが達成できるか?
  • RQ3PG-TSは、合成データおよび実世界のデータにおいて、Laplace-TS や GLM-UCB といった最先端のベースラインと比較して、経験的にどの程度の性能を示すか?
  • RQ4PG-TSは、実世界のアプリケーションで一般的なストリーミングまたは遅延更新設定でも、強力な性能を維持できるか?
  • RQ5Pólya-Gamma補完は、高次元または非ガウス的特徴設定において、収束速度およびリグレット最小化にどのような影響を与えるか?

主な発見

  • PG-TSは、合成データおよび実世界のデータ(フォレストカバータイプデータセット含む)において、累積リグレットの観点でLaplace-TS や GLM-UCB を顕著に上回った。
  • フォレストカバータイプデータセットにおいて、PG-TSはより低いリグレットと高速な収束を達成し、Laplace-TSがしばしば部分的最適なアームに閉じ込められるのとは対照的に、探索効率の顕著な向上を示した。
  • Yahoo! Today Moduleのニュース推薦タスクでは、PG-TSは全遅延設定においてLaplace-TSよりも高い平均クリックストラックレート(CTR)を達成し、特に短い遅延下で最大の利点が見られた。
  • PG-TSにおける上位アームの選択頻度の中央値は、Laplace-TSと比較してよりバランスが取れており、部分的最適なアームへの過早な収束をより効果的に回避していることを示している。
  • PG-TS-streamは、最小限の計算コストで高い性能を維持しており、精度を損なわずにストリーミングデプロイメントの可能性を示した。
  • PG-TSにおけるコンテキスト特徴量の共分散の明示的モデリングは、特にLaplace-TSが性能を発揮できない高次元または非ガウス的特徴領域において、より強固で適応的な探索を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。