Skip to main content
QUICK REVIEW

[論文レビュー] Bandits with heavy tail

Sébastien Bubeck, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|Sep 8, 2012
Advanced Bandit Algorithms Research参考文献 12被引用数 8
ひとこと要約

本稿は弱いモーメント仮定の下での確率的マルチアームバンディットを研究し、有限分散(2次のモーメント)が十分であることを示しており、これはサブガウス分布と同等の対数的レジストを達成できることを意味する。本稿では、経験的平均に代わるロバストな平均推定法—切り捨て平均、カトニのM推定量、およびメジアン・オブ・メーンズ—を導入し、失敗確率に関して多項式スケーリングされる信頼区間を可能にした。これにより、$1+\varepsilon$次のモーメントを持つ重たい尾を持つ報酬に対しても、定数要因を除いて最適なレジストが達成可能となる。主な結果として、レジストが$O\left(\sum_i \left(\frac{1}{\Delta_i}\right)^{1/\varepsilon} \log n\right)$に比例することを示し、下界がこの依存関係が避けられないことを証明している。

ABSTRACT

The stochastic multi-armed bandit problem is well understood when the reward distributions are sub-Gaussian. In this paper we examine the bandit problem under the weaker assumption that the distributions have moments of order 1+ε, for some $ε\in (0,1]$. Surprisingly, moments of order 2 (i.e., finite variance) are sufficient to obtain regret bounds of the same order as under sub-Gaussian reward distributions. In order to achieve such regret, we define sampling strategies based on refined estimators of the mean such as the truncated empirical mean, Catoni's M-estimator, and the median-of-means estimator. We also derive matching lower bounds that also show that the best achievable regret deteriorates when ε<1.

研究の動機と目的

  • 報酬分布のモーメントが$1+\varepsilon$次($\varepsilon \in (0,1]$)に有限であるが、サブガウス的尾を持たない場合の確率的マルチアームバンディットを分析すること。
  • 重たい尾を持つ分布における経験的平均の悪い集中性質が、先行研究で劣化したレジストを引き起こす問題を克服すること。
  • 弱いモーメント仮定のもとで最適なレジストスケーリングを達成するロバストな平均推定に基づくサンプリング戦略を設計すること。
  • 上界と下界を一致させ、導出された境界が定数要因を除いて最適であることを証明すること。

提案手法

  • 弱いモーメント条件のもとで強い集中性質を示す推定量を用いた、ロバストな上側信頼区間(UCB)戦略の一般枠組みを提案する。
  • 3種類のロバストな平均推定量(切り捨て経験的平均、カトニの$M$推定量、メジアン・オブ・メーンズ推定量)を用い、それぞれがサブ・ヴァイブル尾の境界を提供することを示す。
  • これらの推定量のための集中不等式を導出し、乖離確率が$n^{-\varepsilon}$の速度で減少することを示し、経験的平均の多項式減衰よりも改善されることを示す。
  • これらの推定量を用いて信頼区間を構築し、保証されたレジストを持つロバストなUCBアルゴリズムを構築する。
  • 推定量のモーメント母関数にLegendre-Fenchel変換を適用し、タイトな信頼区間を導出する。
  • 特定の重たい尾を持つ分布に基づく新規な下界の議論を用い、レジストにおける$1/\Delta_i^{1/\varepsilon}$依存関係が避けられないことを示す。

実験結果

リサーチクエスチョン

  • RQ1報酬分布のモーメントが2次(有限分散)に限られるがサブガウス的尾を持たない場合、確率的バンディットで対数的レジストを達成できるか?
  • RQ2切り捨て平均やメジアン・オブ・メーンズなどのロバストな平均推定法は、重たい尾を持つ分布において経験的平均よりも著しく優れた集中性質を示すか?
  • RQ3報酬のモーメントが$1+\varepsilon$次($\varepsilon < 1$)であるとき、ギャップ$\Delta_i$に依存する最適なレジストの依存関係は何か?
  • RQ4$L^{1+\varepsilon}$モーメント仮定のもとで、レジスト境界における$1/\Delta_i^{1/\varepsilon}$スケーリングは避けられないか?
  • RQ5提案されたレジスト境界が定数要因を除いて最適であることを示すために、一致する下界を導出できるか?

主な発見

  • 有限分散(2次のモーメント)が十分であり、有限のモーメント母関数を持たないにもかかわらず、サブガウス的報酬と同等のオーダーのレジスト境界が達成可能である。
  • $\mathbb{E}|X - \mu|^{1+\varepsilon} \leq v$を満たす分布に対して、提案手法によりレジスト$R_n \leq \sum_{i:\Delta_i > 0} \left(8\left(\frac{4}{\Delta_i}\right)^{1/\varepsilon} \log n + 5\Delta_i\right)$が達成され、これは$n$に関して対数的である。
  • 重たい尾のもとでは経験的平均は指数的尾境界を提供できないため、多項式的レジストに終わる。ロバスト推定量が対数的レジストを達成するために不可欠である。
  • 下界が上界と定数要因を除いて一致することから、レジスト境界における$1/\Delta_i^{1/\varepsilon}$依存関係は避けられないことが示された。
  • 切り捨て平均およびメジアン・オブ・メーンズ推定量は、$\mathbb{P}(|\widehat{\mu} - \mu| > \eta) \leq C n^{-\varepsilon} \eta^{-(1+\varepsilon)}$というサブ・ヴァイブル尾の挙動を示し、タイトな信頼区間を可能にする。
  • 本稿では、$\varepsilon \to 0$に伴い達成可能な最良のレジストが劣化することを確立し、$L^{1+\varepsilon}$モーメント仮定のもとで$1/\Delta_i^{1/\varepsilon}$スケーリングが最適であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。