Skip to main content
QUICK REVIEW

[論文レビュー] Optimality of Thompson Sampling for Gaussian Bandits Depends on Priors

Junya Honda, Akimichi Takemura|arXiv (Cornell University)|Nov 8, 2013
Advanced Bandit Algorithms Research被引用数 21
ひとこと要約

この論文は、平均と分散が未知のガウス型バンディット問題におけるトンプソンサンプリング(TS)が、特定の事前分布のもとでのみ 渐近的最適性を達成することを確立している。具体的には、一様事前分布が理論的レグレットバウンドを達成するが、ジェファレーズおよびリファレンス事前分布ではその達成に失敗し、多項式レグレットが生じる。本研究は、多パrameterモデルにおけるTSの性能が事前分布の選択に著しく依存することを示している。

ABSTRACT

In stochastic bandit problems, a Bayesian policy called Thompson sampling (TS) has recently attracted much attention for its excellent empirical performance. However, the theoretical analysis of this policy is difficult and its asymptotic optimality is only proved for one-parameter models. In this paper we discuss the optimality of TS for the model of normal distributions with unknown means and variances as one of the most fundamental example of multiparameter models. First we prove that the expected regret of TS with the uniform prior achieves the theoretical bound, which is the first result to show that the asymptotic bound is achievable for the normal distribution model. Next we prove that TS with Jeffreys prior and reference prior cannot achieve the theoretical bound. Therefore the choice of priors is important for TS and non-informative priors are sometimes risky in cases of multiparameter models.

研究の動機と目的

  • 平均と分散が未知の正規分布に従うマルチアームバンディット問題におけるトンプソンサンプリング(TS)の漸近的最適性を調査すること。
  • この基本的な多パrameterモデルにおいて、TSが期待レグレットの理論的下界に達するかを特定すること。
  • 一様、ジェファレーズ、リファレンスといった非情報的事前分布の違いが、TSのレグレット性能に与える影響を評価すること。
  • 特に漸近的最適性を求める状況において、非情報的事前分布が安全か危険かを明確にすること。

提案手法

  • 平均と分散が未知の正規分布に従うK腕の確率的バンディット問題を形式化すること。
  • 期待レグレットを、時間経過に伴う最適報酬と実際の報酬の累積差として定義すること。
  • 共役事前分布を用いたベイズ更新により、平均および分散パラメータの事後分布をモデル化すること。
  • 大偏差理論およびチェルノフ補題を用いて、標本平均および二乗和の尾確率を分析すること。
  • 事前分布に基づいて、劣悪な腕が選択される事後確率の上限を導出すること。
  • 一様事前分布では理論的下界に一致する対数的レグレットが得られることを証明するが、ジェファレーズおよびリファレンス事前分布では多項式レグレットが生じることを示す。

実験結果

リサーチクエスチョン

  • RQ1平均と分散が未知のガウス型バンディット問題において、トンプソンサンプリングは理論的漸近的レグレットバウンドを達成するか?
  • RQ2一様、ジェファレーズ、リファレンスといった事前分布の選択が、この多パrameterモデルにおけるトンプソンサンプリングのレグレット性能にどのように影響するか?
  • RQ3ジェファレーズやリファレンスといった非情報的事前分布が、多パrameterバンディット問題において最適でないレグレットを引き起こす可能性があるか?
  • RQ4漸近的最適性が、非情報的であっても事前分布の指定に敏感であるか?
  • RQ5期待レグレットの正確な挙動、特に成長率(対数的 vs. 多項式)の観点から、異なる事前分布のもとでの挙動は何か?

主な発見

  • 平均と分散が未知のガウス型バンディット問題において、一様事前分布を用いたトンプソンサンプリングは、理論的漸近的レグレットバウンドに達する。
  • ジェファレーズ事前分布を用いたトンプソンサンプリングは理論的バウンドに達せず、期待値において多項式レグレットを示す。
  • リファレンス事前分布を用いたトンプソンサンプリングも理論的バウンドに達せず、同様に非最適なレグレット挙動を示す。
  • 事前分布の選択は、非情報的であっても多パrameterモデルにおけるトンプソンサンプリングの性能に顕著な影響を与える。
  • 本研究は、非情報的事前分布が多パrameter設定において危険である可能性を明らかにした。これは、過剰に楽観的な事後信念を生じさせ、探索が不十分になるおそれがあるためである。
  • 理論的分析により、このクラスのバンディット問題における漸近的最適性を保証するのは、一様事前分布のような特定の事前分布に限ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。