Skip to main content
QUICK REVIEW

[論文レビュー] Statistical Efficiency of Thompson Sampling for Combinatorial Semi-Bandits

Pierre Perrault, Étienne Boursier|arXiv (Cornell University)|Jun 11, 2020
Advanced Bandit Algorithms Research参考文献 36被引用数 7
ひとこと要約

本論文は、二つの主要な設定下で、確率的組合せ的マルチアームバンディットに半バンドイットフィードバックを適用した組合せ的トーマプソンサンプリング(CTS)の、最初のタイトなレグレット解析を確立した。それぞれの設定は、[0,1] に値する互いに独立な結果にベータ事前分布を用いる場合、および多変量のサブガウス型結果にガウス事前分布を用いる場合である。本論文は、CTS が対数因子を除いて最適な漸近的レグレットを達成することを証明し、最適ではあるが計算的に非現実的な ESCB 政策の計算効率の良い代替手段を提供する。

ABSTRACT

We investigate stochastic combinatorial multi-armed bandit with semi-bandit feedback (CMAB). In CMAB, the question of the existence of an efficient policy with an optimal asymptotic regret (up to a factor poly-logarithmic with the action size) is still open for many families of distributions, including mutually independent outcomes, and more generally the multivariate sub-Gaussian family. We propose to answer the above question for these two families by analyzing variants of the Combinatorial Thompson Sampling policy (CTS). For mutually independent outcomes in $[0,1]$, we propose a tight analysis of CTS using Beta priors. We then look at the more general setting of multivariate sub-Gaussian outcomes and propose a tight analysis of CTS using Gaussian priors. This last result gives us an alternative to the Efficient Sampling for Combinatorial Bandit policy (ESCB), which, although optimal, is not computationally efficient.

研究の動機と目的

  • 組合せ的半バンドイットにおけるトーマプソンサンプリングの理論的理解のギャップを埋めるために、タイトなレグレットバウンドを確立すること。
  • 互いに独立な[0,1]-有界結果にベータ事前分布を用いた CTS の分析を行い、最適なレグレットスケーリングを達成すること。
  • 多変量サブガウス型結果にガウス事前分布を用いた設定への分析を拡張し、ESCB の計算効率の良い代替手段を提供すること。
  • CTS が対数因子を除いて最適な漸近的レグレットを達成することを示すこと。情報理論的下界に一致する。

提案手法

  • 独立した[0,1]-有界結果に対して、ベータ事前分布を用いた組合せ的トーマプソンサンプリング(CTS)の変種を提案する。
  • 逆アモアタイゼーションとイベントフィルタリングに基づく、新たな解析フレームワークを導入し、期待レグレットのバウンドを確立する。
  • ガウス事前分布から導かれる楕円型信頼領域を用いて、多変量サブガウス型結果をモデル化する。
  • 逆アモアタイゼーション技術を用いて、最適でない腕とのギャップが小さいラウンドが寄与するレグレットを制御する。
  • ギャップが小さいイベントの上でのレグレットをフィルタリングするための合成ボーナス分解を用いる。
  • 信頼幅の逆関数を用いた積分近似と尾確率制御により、レグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1独立した結果を持つ組合せ的半バンドイットにおいて、トーマプソンサンプリングは最適な漸近的レグレットを達成できるか?
  • RQ2ベータ事前分布を用いた CTS は、情報理論的下界に一致するタイトなレグレットバウンドを達成できるか?
  • RQ3ガウス事前分布を用いた CTS は、多変量サブガウス型設定において最適なレグレットを達成できるか、かつ計算的に効率的か?
  • RQ4ESCB は最適ではあるが計算的に高コストであるが、CTS のレグレットはそれと比べてどうか?

主な発見

  • 独立した[0,1]-有界結果に対して、ベータ事前分布を用いた CTS は、O(n log T / Δ) のオーダーのレグレットバウンドを達成し、情報理論的下界に対数因子を除いて一致する。
  • 多変量サブガウス型結果に対して、ガウス事前分布を用いた CTS は最適なレグレットスケーリングを達成し、ESCB 政策の計算効率の良い代替手段を提供する。
  • 解析により、CTS の期待レグレットが、ℓ₁-ノルム誤差に対して O(∑ᵢ βᵢ,ₜ / (m Δᵢ,ₘᵢₙ)) で上界されると証明された。ここで βᵢ,ₜ は信頼幅を制御するためのパラメータである。
  • 逆アモアタイゼーション技術により、ギャップが小さいラウンドからのレグレット寄与をタイトに制御でき、最小ギャップ Δ に最適な依存関係が得られた。
  • ESCB が最適ではあるが大規模問題には非現実的であるのに対し、提案手法は複雑な最適化を必要とせず、最適なレグレットスケーリングを達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。