Skip to main content
QUICK REVIEW

[論文レビュー] A Scale Free Algorithm for Stochastic Bandits with Bounded Kurtosis

Tor Lattimore|arXiv (Cornell University)|Mar 27, 2017
Machine Learning and Algorithms被引用数 8
ひとこと要約

本稿では、尖度が有界であるという仮定の下で対数的リグレットを達成するスケールフリーな確率的マルチアームバンディット用のアルゴリズムを提示する。このアルゴリズムは、尖度に基づく中央値の平均推定と信頼区間を用い、未知の分散や位置パラメータに適応し、スケールパラメータの事前知識なしに最適なリグレットスケーリングを達成する。これは、従来の正規分布や一様分布に限られた結果を、非パラメトリックな設定へ一般化するものである。

ABSTRACT

Existing strategies for finite-armed stochastic bandits mostly depend on a parameter of scale that must be known in advance. Sometimes this is in the form of a bound on the payoffs, or the knowledge of a variance or subgaussian parameter. The notable exceptions are the analysis of Gaussian bandits with unknown mean and variance by Cowan and Katehakis [2015] and of uniform distributions with unknown support [Cowan and Katehakis, 2015]. The results derived in these specialised cases are generalised here to the non-parametric setup, where the learner knows only a bound on the kurtosis of the noise, which is a scale free measure of the extremity of outliers.

研究の動機と目的

  • 分散や報酬の上限などのスケールパラメータの事前知識が不要なバンディットアルゴリズムを構築すること。
  • 従来のスケールフリーな結果(主に正規分布や一様分布に限られていた)を、尖度を用いた頑健な尾部挙動の測度として非パラメトリックな設定へ一般化すること。
  • スケールフリーな外れ値出現確率の測度としての尖度が、確率的バンディットにおける信頼区間とリグレットの制御に十分であることを確立すること。
  • アルゴリズムが位置変換およびスケール変換に対して不変であることを示し、異なる報酬分布に対して頑健であることを示すこと。

提案手法

  • 各アームの報酬平均を頑健に推定するために中央値の平均推定を用い、重い尾部の外れ値への感受性を低減する。
  • 既知の尖度の上界に基づいて信頼区間を構築し、サブガウス性や有界なサポートを仮定せず、スケールフリーな信頼区間を実現する。
  • 尖度依存の分散推定を組み込んだUCBスタイルの探索と活用のトレードオフを管理する。
  • 有界な尖度に基づく集中不等式を用いたリグレット解析により、重い尾部の報酬でも推定誤差をきめ細かく制御する。
  • アルゴリズムは平行移動およびスケーリングに対して不変である:報酬に定数倍を施してもリグレットはそれに比例してスケーリングされ、性能は保たれる。
  • サブガウス性や有界分散の仮定に依存しない、自己正規化過程と中央値の平均技術を用いて理論的保証を導出する。

実験結果

リサーチクエスチョン

  • RQ1分散や有界なサポートといった既知のスケールパラメータがなくても、確率的バンディットで対数的リグレットを達成できるか?
  • RQ2尖度は、正規分布や一様分布のようなパラメトリックモデルを超えて一般化可能な、頑健なバンディットアルゴリズムを設計するのに十分で、かつスケールフリーな条件であるか?
  • RQ3報酬分布の尾部挙動が、唯一尖度が既知である場合に、バンディットアルゴリズムの性能にどのように影響するか?
  • RQ4スケールフリーであり、かつ尖度が有界な非パラメトリックな設定で、最適なリグレットを達成できるバンディットアルゴリズムは存在するか?

主な発見

  • 提案されたアルゴリズムは、$\limsup_{n\to\infty}\frac{\mathcal{R}_{n}}{\log(n)} \leq C\sum_{i:\Delta_{i}>0}\Delta_{i}\left(\kappa-1+\frac{\sigma^{2}_{i}}{\Delta_{i}^{2}}\right)$ の形のリグレットバウンドを達成する。ここで $\kappa$ は尖度の既知の上界、$C>0$ は普遍定数である。
  • リグレットバウンドはスケールおよび位置不変である。これは、報酬に線形変換を施してもアルゴリズムの性能が変わらないことを意味する。
  • アルゴリズムは、正規分布や一様分布のバンディットに関する先行結果を、尖度が唯一の構造的仮定である非パラメトリッククラスへ一般化する。
  • バウンドは、$\kappa \ll \kappa_\circ$ の場合に、パrameter spaceの内部で既知の下界と定数因子を除いて一致するという意味でタイトである。
  • 解析により、尖度が尾部挙動の意味のある代理指標を提供することが示され、分散が未知であっても頑健な信頼区間を可能にする。
  • 方法は、高尖度を示すベルヌーイ分布のような境界ケースでも有効であるが、一般バウンドとは異なるリグレットスケーリングを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。