Skip to main content
QUICK REVIEW

[論文レビュー] Selecting the best system and multi-armed bandits

Peter W. Glynn, Sandeep Juneja|arXiv (Cornell University)|Jul 16, 2015
Advanced Bandit Algorithms Research参考文献 28被引用数 9
ひとこと要約

本稿では、無限大のサポートを有する軽尾分布に対して、$1 - \delta$ の確率で正しい最良システム選択を保証するようなアルゴリズムは、期待的に $O(\log(1/\delta))$ のサンプル数では存在しないことが示されている。これは、必要な期待サンプルサイズが無限大になってしまうためである。著者らは、モーメント制約がないと、このような保証が本質的に誤解を招くものであることを証明しているが、高階モーメントが有界である場合には、$O\left(\log(1/\delta)\right)$ のアルゴリズムが実現可能であることを示している。

ABSTRACT

Consider the problem of finding a population or a probability distribution amongst many with the largest mean when these means are unknown but population samples can be simulated or otherwise generated. Typically, by selecting largest sample mean population, it can be shown that false selection probability decays at an exponential rate. Lately, researchers have sought algorithms that guarantee that this probability is restricted to a small $δ$ in order $\log(1/δ)$ computational time by estimating the associated large deviations rate function via simulation. We show that such guarantees are misleading when populations have unbounded support even when these may be light-tailed. Specifically, we show that any policy that identifies the correct population with probability at least $1-δ$ for each problem instance requires infinite number of samples in expectation in making such a determination in any problem instance. This suggests that some restrictions are essential on populations to devise $O(\log(1/δ))$ algorithms with $1 - δ$ correctness guarantees. We note that under restriction on population moments, such methods are easily designed, and that sequential methods from stochastic multi-armed bandit literature can be adapted to devise such algorithms.

研究の動機と目的

  • 未知の平均をもつ $d$ 個の母集団の中から、$O(\log(1/\delta))$ のサンプル数で $1 - \delta$ の正しさを保証できるアルゴリズムが存在するかを調査すること。
  • 右側に無限大のサポートをもつ軽尾分布において、誤った選択確率の指数的減衰が、有限の期待サンプル複雑度を保証するのに十分かどうかを分析すること。
  • $O(\log(1/\delta))$ のアルゴリズムが高信頼性保証を満たす条件を同定すること。
  • 純粋な探索設定における、大偏差に基づくアプローチの限界を明確にすること。
  • このようなアルゴリズムにおいて、期待サンプル複雑度が有限であるためにモーメント制約が本質的であることを確立すること。

提案手法

  • 独立同分布のサンプリングに基づく $d$ 個の母集団からの誤った選択確率の指数的減衰率を、大偏差理論を用いて分析する。
  • 無限大のサポートをもつ軽尾分布の族を用いた反例を構築し、$1 - \delta$ の正しさを保証するいかなる方策に対しても、期待サンプル複雑度が無限大になることを示す。
  • モーメント制約の下で、大偏差レート関数を最適化するための変分的アプローチを適用する。
  • 部分Weibull分布に従う確率変数に対するBernstein型不等式を用いて、切り捨て推定量のバイアスの境界を導出する。
  • モーメント制約の下で、確率的マルチアームバンディット文脈からの逐次的サンプリング方策を適応する。
  • 微積分および最適化を用いて、導出された制約の下で、最適なサンプリング戦略が極端な点に質量を集約することを示す。

実験結果

リサーチクエスチョン

  • RQ1母集団のサポートが無限大である場合、$O(\log(1/\delta))$ のサンプル数で最良腕選択において $1 - \delta$ の正しさを達成できるアルゴリズムは存在するか?
  • RQ2サポートが無限大である場合、誤った選択確率の指数的減衰が、有限の期待サンプル複雑度を保証するのに十分か?
  • RQ3モーメント条件は、$O(\log(1/\delta))$ のアルゴリズムが高信頼性保証を満たすために果たす役割は何か?
  • RQ4大偏差に基づくアプローチは、すべての軽尾分布に対して有効であるのか、それとも隠れた仮定があるのか?
  • RQ5マルチアームバンディットにおける逐次的サンプリング方策は、モーメント制約の下で $O(\log(1/\delta))$ のサンプル複雑度を達成するために適応可能か?

主な発見

  • 無限大のサポートをもつ軽尾分布に対しては、$1 - \delta$ の正しさを保証するいかなる方策に対しても、期待サンプル数が無限大になる。
  • サポートが無限大である場合、誤った選択確率の指数的減衰は、有限の期待サンプル複雑度を保証するものではない。
  • モーメントが有界である条件下では、$1 - \delta$ の正しさ保証をもつ $O(\log(1/\delta))$ のアルゴリズムを構築可能である。
  • モーメント制約の下での最適なサンプリング戦略は、極端な点に質量を集約し、最適なしきい値は部分Weibull尾パラメータによって決定される。
  • 部分Weibull変数に対するBernstein不等式により、切り捨て推定量のバイアスを制御でき、有限サンプル解析が可能になる。
  • モーメント制約の下で誤った選択確率を最小化する最適な割り当て戦略は、変分的最適化によって導出される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。