Skip to main content
QUICK REVIEW

[論文レビュー] Racing Thompson: an Efficient Algorithm for Thompson Sampling with Non-conjugate Priors

Yichi Zhou, Jun Zhu|arXiv (Cornell University)|Aug 16, 2017
Advanced Bandit Algorithms Research参考文献 16被引用数 4
ひとこと要約

本稿では、Gumbel-Maxのテクニックを用いて非共役事前分布におけるチューリングサンプリングを最良腕同定問題に再定式化することにより、後方分布推論が困難な状況でも効率的なチューリングサンプリングを実現するRacing Thompsonというアルゴリズムを提案する。この手法は、正確な後方分布推論を回避するため、取り扱いやすい提案分布からサンプリングすることで実現され、非共役事前分布および構造的事前分布の両設定において、SMCおよび共役事前分布ベースラインを上回る優れた性能を発揮する。

ABSTRACT

Thompson sampling has impressive empirical performance for many multi-armed bandit problems. But current algorithms for Thompson sampling only work for the case of conjugate priors since these algorithms require to infer the posterior, which is often computationally intractable when the prior is not conjugate. In this paper, we propose a novel algorithm for Thompson sampling which only requires to draw samples from a tractable distribution, so our algorithm is efficient even when the prior is non-conjugate. To do this, we reformulate Thompson sampling as an optimization problem via the Gumbel-Max trick. After that we construct a set of random variables and our goal is to identify the one with highest mean. Finally, we solve it with techniques in best arm identification.

研究の動機と目的

  • 非共役事前分布下におけるチューリングサンプリングにおける後方分布推論の計算的非可解性に対処すること。
  • 共役事前分布が不適切または非効率となる複雑なモデルにおいて、効率的かつスケーラブルなチューリングサンプリングを可能にすること。
  • 完全な後方分布計算を回避しつつも、強力な経験的性能を維持する理論的裏付けのある手法を提供すること。
  • 非共役設定において、原理的停止ルールとサンプルサイズの決定法を備えた実用的アルゴリズムを開発すること。

提案手法

  • Gumbel-Maxのテクニックを用いて、後方分布からのサンプリングをGumbel分布による摂動を加えた確率的変数の最大化問題に再定式化することで、チューリングサンプリングを最良腕同定(BAI)問題に再定式化する。
  • 非共役事前分布下での正確な後方分布推論の必要性を回避するため、取り扱いやすい提案分布を構築し、そこからサンプリングする。
  • 最良腕同定の理論的保証を活用して、摂動された変数のうち期待値が最大の腕を特定するレーシング形式のアルゴリズムを用いる。
  • サブガウス確率変数の濃度に基づく停止ルールを用いて、適応的にサンプル数を決定し、理論的性能バインディングを保証する。
  • 提案分布からサンプルを抽出し、Gumbel-max基準に従って行動を選択する、逐次的意思決定フレームワークにこの手法を統合する。
  • 最良腕同定の定式化に含まれる確率変数のサブガウス性を仮定することで、理論的妥当性を保証する。

実験結果

リサーチクエスチョン

  • RQ1後方分布推論を要しない非共役事前分布設定において、チューリングサンプリングを効率的に実装できるか。
  • RQ2Gumbel-Maxのテクニックをどのように活用して、チューリングサンプリングを最良腕同定問題に再定式化できるか。
  • RQ3非共役チューリングサンプリングにおいて、理論的保証のもとで必要なサンプル数を原理的かつ適切に決定する方法は何か。
  • RQ4提案手法の性能は、非共役および構造的事前分布の状況において、SMCおよび共役事前分布ベースラインと比べてどのように異なるか。

主な発見

  • Racing Thompsonは、ベルヌーイバンディットにおける不適切なベータ事前分布を用いたチューリングサンプリングよりも著しく優れており、時間ステップが増加するにつれてその差が顕著になる。
  • 初期段階では、少数の粒子で動作するSMCと同等の性能を達成するが、観測数が増加するにつれてSMCを上回る。
  • 切断ガウス事前分布を伴う非共役設定において、Racing Thompsonは累積レギュレートの観点でSMCおよび共役事前分布チューリングサンプリングを上回る。
  • 依存する腕(例:トピックベースの相関関係)を含む構造的事前分布においても、本手法は優れた性能を維持し、SMCおよび共役事前分布ベースラインを上回る。
  • 理論的分析により、サブガウス仮定の下で停止ルールが理論的に妥当であり、原理的かつ適切なサンプルサイズ選択メカニズムを提供することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。