Skip to main content
QUICK REVIEW

[論文レビュー] On the Prior Sensitivity of Thompson Sampling

Che-Yu Liu, Lihong Li|arXiv (Cornell University)|Jun 10, 2015
Advanced Bandit Algorithms Research参考文献 25被引用数 6
ひとこと要約

本稿は、確率的マルチアームバンディット問題におけるトゥーリング・サンプリングの事前分布への感受性について、厳密な理論的分析を提供する。martingale理論とトゥーリング・サンプリングの新しい構造的性質を用いて、真のモデルの事前確率を$p$とするとき、不良事前分布の場合には$O(\sqrt{T/p})$、良好事前分布の場合には$O(\sqrt{(1-p)T})$のタイトなレグレットバウンドを確立する。

ABSTRACT

The empirically successful Thompson Sampling algorithm for stochastic bandits has drawn much interest in understanding its theoretical properties. One important benefit of the algorithm is that it allows domain knowledge to be conveniently encoded as a prior distribution to balance exploration and exploitation more effectively. While it is generally believed that the algorithm's regret is low (high) when the prior is good (bad), little is known about the exact dependence. In this paper, we fully characterize the algorithm's worst-case dependence of regret on the choice of prior, focusing on a special yet representative case. These results also provide insights into the general sensitivity of the algorithm to the choice of priors. In particular, with $p$ being the prior probability mass of the true reward-generating model, we prove $O(\sqrt{T/p})$ and $O(\sqrt{(1-p)T})$ regret upper bounds for the bad- and good-prior cases, respectively, as well as \emph{matching} lower bounds. Our proofs rely on the discovery of a fundamental property of Thompson Sampling and make heavy use of martingale theory, both of which appear novel in the literature, to the best of our knowledge.

研究の動機と目的

  • トゥーリング・サンプリングのレグレットが事前分布の選択にどのように依存するかを理論的に理解すること。
  • 真のモデルについて事前分布が不正確($p$が小さい)または正確($p$が大きい)である場合の最悪ケースのレグレットを特定すること。
  • 事前分布の質への感受性を定量化するために、上界と下界が一致するレグレットバウンドを確立すること。
  • 特にmartingale手法を通じて、解析を可能にするトゥーリング・サンプリングの根本的な構造的性質を同定すること。

提案手法

  • 事前分布の感受性を研究する代表的なケースとして、2モデル・2アクションのバンディット設定を分析する。
  • martingale理論を用いて、事後分布の集中度およびアクション選択確率のバウンドを導出する。
  • 観測された報酬に基づいて、モデル上の事後分布を再帰的にモデル化するためのベイズ更新ルールを適用する。
  • 異なる事前重みにおける期待レグレットを比較することで、レグレットの再帰的不等式を導出する。
  • 異なる事前分布におけるレグレットの差をバウンドするために、モデル間のカップリング論法を用いる。
  • varying prior masses $p$のベルヌーイ・バンディットにおける実験により、理論的結果を検証する。

実験結果

リサーチクエスチョン

  • RQ1真のモデルの事前確率$p$がレグレットにどのように影響するか?
  • RQ2事前分布が良好($p \approx 1$)または不良($p \approx 0$)である場合の、タイトな上界および下界は何か?
  • RQ3代表的なバンディット設定において、レグレットの事前分布の質への依存関係を完全に特徴づけられるか?
  • RQ4トゥーリング・サンプリングのどのような根本的構造的性質が、このような高精度なレグレット解析を可能にするか?

主な発見

  • 真のモデルに事前重み$p$を持つ不良事前分布の場合、レグレットは$O(\sqrt{T/p})$で上界が抑えられ、このバウンドはタイトである。
  • 真のモデルに事前重み$p$を持つ良好事前分布の場合、レグレットは$O(\sqrt{(1-p)T})$で上界が抑えられ、このバウンドもタイトである。
  • 本稿は一致する下界を確立し、不良事前分布と良好事前分布の両方において、レグレットが$\Theta(\sqrt{T/p})$および$\Theta(\sqrt{(1-p)T})$のスケーリングに従うことを確認した。
  • 解析により、事前分布の質への感受性が顕著であることが判明した。事前分布が弱い場合、レグレットは$\sqrt{1/p}$に比例して増加し、強い場合も$\sqrt{1-p}$に比例して増加する。
  • 実験結果は、予測された$\sqrt{1/p}$および$\sqrt{1-p}$に比例するレグレットの線形スケーリングを支持しており、理論的バウンドのタイトさを裏付けている。
  • martingale理論およびトゥーリング・サンプリングの行動に関する新しい構造的知見の活用により、アルゴリズムのより広範な解析に応用可能なツールが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。