Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Time Regret of Thompson Sampling Algorithms for Exponential Family Multi-Armed Bandits

Tianyuan Jin, Pan Xu|arXiv (Cornell University)|Jun 7, 2022
Advanced Bandit Algorithms Research被引用数 7
ひとこと要約

本稿では、最適な腕の平均値の過小評価を防ぐために、新たなサンプリング分布を用いる指数型分散の多腕バンディット問題におけるThompson samplingアルゴリズムExpTSを提案する。ExpTSは、有限時刻におけるレグレットバウンドを、sub-UCB基準と一致させ、√log K要因の誤差を除いてミニマックス最適性を達成し、漸近的最適性を満たす。このアルゴリズムは、ベルヌーイ分布、正規分布、ガンマ分布を含む多様な指数型分布に一般化可能な、包括的で概念的に単純な理論的フレームワークを備えている。

ABSTRACT

We study the regret of Thompson sampling (TS) algorithms for exponential family bandits, where the reward distribution is from a one-dimensional exponential family, which covers many common reward distributions including Bernoulli, Gaussian, Gamma, Exponential, etc. We propose a Thompson sampling algorithm, termed ExpTS, which uses a novel sampling distribution to avoid the under-estimation of the optimal arm. We provide a tight regret analysis for ExpTS, which simultaneously yields both the finite-time regret bound as well as the asymptotic regret bound. In particular, for a $K$-armed bandit with exponential family rewards, ExpTS over a horizon $T$ is sub-UCB (a strong criterion for the finite-time regret that is problem-dependent), minimax optimal up to a factor $\sqrt{\log K}$, and asymptotically optimal, for exponential family rewards. Moreover, we propose ExpTS$^+$, by adding a greedy exploitation step in addition to the sampling distribution used in ExpTS, to avoid the over-estimation of sub-optimal arms. ExpTS$^+$ is an anytime bandit algorithm and achieves the minimax optimality and asymptotic optimality simultaneously for exponential family reward distributions. Our proof techniques are general and conceptually simple and can be easily applied to analyze standard Thompson sampling with specific reward distributions.

研究の動機と目的

  • ベルヌーイ分布や正規分布といった一般的な分布を含む指数型バンディット問題におけるThompson samplingの有限時刻におけるレグレット解析が不足しているという問題に対処すること。
  • 有限時刻におけるレグレットバウンドがsub-UCB基準と一致する、かつ漸近的最適性を同時に達成するThompson samplingアルゴリズムの設計。
  • 標準的なThompson samplingの過小評価という欠陥を回避するため、新たなサンプリング分布を用いて最適な腕の平均値の過小評価を防ぐこと。
  • 一般化された指数型報酬分布に対して、統一的かつ概念的に単純な証明フレームワークを用いて理論的解析を拡張すること。
  • ExpTS+を提案する。これは、グリーディな報酬利用ステップを追加することで、非最適な腕の過大評価をさらに防ぎつつ、最適性を維持する、いつでも利用可能なアルゴリズムである。

提案手法

  • 最適な腕の平均値の過小評価を回避するために、修正されたサンプリング分布を用いるExpTSというThompson samplingアルゴリズムを提案する。
  • Kullback-Leibler距離と経験的平均の集中性に基づく、新たなサンプリングメカニズムを導入し、推定精度を向上させる。
  • 指数型分布に対する最大不等式と尾確率バウンドに基づく証明技術を用い、タイトなレグレットバウンドを導出する。
  • 連続状態におけるレグレットバウンドを制限するために、真の事後分布と代理分布との間の離散化と比較の議論を適用する。
  • ExpTSにグリーディな報酬利用ステップを追加することで、ExpTS+を設計し、非最適な腕の過大評価を防止する。
  • KL距離と集中不等式に基づく一般化されたフレームワークを用いて、指数型分布の全範囲にわたる有限時刻および漸近的レグレット解析を実施する。

実験結果

リサーチクエスチョン

  • RQ1Thompson samplingは、指数型バンディット問題において、sub-UCB基準に一致する有限時刻におけるレグレットバウンドを達成できるか?
  • RQ2Thompson samplingは、指数型報酬において漸近的最適性を達成できるのか?また、有限時刻解析によってその証明は可能か?
  • RQ3修正されたサンプリング分布を用いるThompson samplingの変種は、最適な腕の平均値の過小評価を回避できるか?
  • RQ4指数型報酬に対して、ミニマックス最適性と漸近的最適性を同時に満たす、いつでも利用可能なバンディットアルゴリズムを設計することは可能か?
  • RQ5証明技法は、ベルヌーイ分布や正規分布といった特定のケースを超えて、広範な指数型分布クラスに一般化可能か?

主な発見

  • ExpTSは、sub-UCB基準と一致する有限時刻におけるレグレットバウンドを達成しており、問題依存的かつすべての指数型バンディット問題に対してタイトである。
  • ExpTSは、√log K要因の誤差を除いてミニマックス最適であり、最悪ケースのレグレットがすべてのK腕バンディットインスタンスでO(√(KT))のスケーリングを示す。
  • ExpTSは漸近的最適性を達成しており、lim_{T→∞} R_μ(T)/log T = ∑_{i>1} (μ₁−μᵢ)/kl(μᵢ,μ₁) を満たす。これは情報理論的下界に一致する。
  • ExpTS+は、ミニマックス最適性と漸近的最適性を同時に達成しており、強力な理論的保証を持ついつでも利用可能なアルゴリズムである。
  • 証明フレームワークは包括的で概念的に単純であり、ベルヌーイ分布や正規分布といった特定の分布に対する標準的なThompson samplingの直接的解析を可能にする。
  • 解析により、ExpTSにおける新たなサンプリング分布が、標準的なTSにおける主要な欠陥である最適な腕の過小評価を効果的に防止することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。