Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotically Optimal Sequential Experimentation Under Generalized Ranking

Wesley Cowan, Michael N. Katehakis|arXiv (Cornell University)|Oct 7, 2015
Advanced Bandit Algorithms Research参考文献 30被引用数 4
ひとこと要約

本稿は、任意のスコア関数形を用いた多腕バンディット問題における逐次的実験の一般化されたフレームワークを提案する。これは平均に基づく最適化をはるかに超えるものである。本稿では、非最適な選択の回数に対する漸近的下界を確立し、特定の信頼区間を備えたUCB型方策が、ややいささかの正則性条件のもとでこの下界に達することを証明する。これにより、パレート分布、一様分布、正規分布に対して、さまざまなスコア関数形において漸近的最適性が保証される。

ABSTRACT

We consider the \mnk{classical} problem of a controller activating (or sampling) sequentially from a finite number of $N \geq 2$ populations, specified by unknown distributions. Over some time horizon, at each time $n = 1, 2, \ldots$, the controller wishes to select a population to sample, with the goal of sampling from a population that optimizes some "score" function of its distribution, e.g., maximizing the expected sum of outcomes or minimizing variability. We define a class of extit{Uniformly Fast (UF)} sampling policies and show, under mild regularity conditions, that there is an asymptotic lower bound for the expected total number of sub-optimal population activations. Then, we provide sufficient conditions under which a UCB policy is UF and asymptotically optimal, since it attains this lower bound. Explicit solutions are provided for a number of examples of interest, including general score functionals on unconstrained Pareto distributions (of potentially infinite mean), and uniform distributions of unknown support. Additional results on bandits of Normal distributions are also provided.

研究の動機と目的

  • N個の母集団から未知の分布を持つものに対して逐次的サンプリングを行う課題に取り組み、最適な選択が期待値ではなく一般化されたスコア関数形によって定義される場合に、その定義を明確にすること。
  • いかなる一様に高速(UF)方策に対しても、非最適アクティベーションの期待値に対する理論的下界を確立すること。
  • UCB型方策がこの下界に達する十分条件を同定し、漸近的最適性を証明すること。
  • 重い尾を持つ、あるいは無限平均をとる分布(例:パレート分布、未知のサポートをもつ一様分布)のような状況においてもバンディットアルゴリズムの適用範囲を拡張すること。
  • 実装可能な多様な分布族とスコア関数形に対応する明示的解と有限時限のバウンドを提供すること。

提案手法

  • 一様に高速(UF)なサンプリング方策のクラスを導入し、非最適なアクティベーションの増加が時間に対して多項式より遅くなることを保証する。
  • Kullback-Leibler発散とスコア関数形の経験的推定値に基づく信頼区間を用いて、UCB-$(\mathcal{F},s,\tilde{d})$ 方策を定義する。
  • 最適分布と非最適分布の間の発散に基づいて、非最適アクティベーションの期待値に対する一般化された漸近的下界を確立する。
  • 統計的分離度を測定し、信頼区間を導出するために、Kullback-Leibler情報発散 $\mathbf{I}(f,g)$ を指標として用いる。
  • R条件(R1′, R2′, R3′)を適用し、スコア関数形および分布族に対するややいささかの正則性条件のもとで、UCB方策が下界に達することを検証する。
  • 正規分布、パレート分布、一様分布の具体的なモデルについて、UCB方策における非最適プルの期待値の明示的漸近的表現を導出する。

実験結果

リサーチクエスチョン

  • RQ1最適バンディットが平均ではなく一般化されたスコア関数形によって定義される場合、逐次的実験における非最適アクティベーションの回数の根本的限界は何か?
  • RQ2どのような条件下でUCB型方策がこの根本的下界に達し、漸近的最適性を保証できるか?
  • RQ3スコア関数形が平均でない場合、例えば無限平均をもつパレート分布の場合、非最適なサンプリングの漸近的挙動はどのように変化するか?
  • RQ4UCBフレームワークは、任意の区間における一様分布のような未知のサポートを持つ分布に対しても拡張可能か?
  • RQ5正規バンディットにおいてスコア関数形が尾確率 $\mathbb{P}(X \geq \kappa)$ の場合、UCB方策における非最適プルの正確な漸近的レートは何か?

主な発見

  • いかなるUF方策に対しても、非最適アクティベーションの期待値は $n$ の任意の正のべきよりも遅く増加する。これは性能のベースラインを確立する。
  • 最適分布と非最適分布の間のKullback-Leibler発散に基づいて、非最適アクティベーションの期待値に対する漸近的下界が導出される。
  • スコア関数形 $s_{\kappa}(f) = \mathbb{P}(X \geq \kappa)$ をもつ正規バンディットモデルにおけるUCB方策 $\pi^{*}_{\kappa}$ は、漸近的に最適であり、導出された下界に達する。
  • しきい値ベースのスコア関数形をもつ正規バンディットモデルでは、非最適プルの漸近的レートは $\lim_{n \to \infty} \frac{\mathbb{E}[T^{i}_{\pi^{*}_{\kappa}}(n)]}{\ln n} = \frac{2}{\left(\frac{\kappa - \mu_i}{\sigma_i} - \Phi^{-1}(1 - s^*) \right)^2}$ である。
  • R条件のもとで、方策が漸近的に最適であることが示され、KL発散と正規近似を用いて連続性、集中性、尾確率バウンドの検証がなされている。
  • 本フレームワークはパレート分布、一様分布、正規分布に適用可能であり、実用的な使用を想定した明示的漸近的表現と有限時限バウンドを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。