Skip to main content
QUICK REVIEW

[論文レビュー] Optimal $δ$-Correct Best-Arm Selection for Heavy-Tailed Distributions

Shubhada Agrawal, Sandeep Juneja|arXiv (Cornell University)|Aug 24, 2019
Machine Learning and Algorithms被引用数 5
ひとこと要約

本稿では、(1+ε)次のモーメントが有限である重たい尾を持つ分布に対して、δ-正しい最良腕特定アルゴリズムを提案し、サンプル複雑度において漸近的最適性を達成する。収束を加速するために、近似的に最適なバッチサイズを用いたバッチ処理を導入し、従来の指数型分布族に限定された手法の限界を克服する。

ABSTRACT

Given a finite set of unknown distributions or arms that can be sampled, we consider the problem of identifying the one with the maximum mean using a $δ$-correct algorithm (an adaptive, sequential algorithm that restricts the probability of error to a specified $δ$) that has minimum sample complexity. Lower bounds for $δ$-correct algorithms are well known. $δ$-correct algorithms that match the lower bound asymptotically as $δ$ reduces to zero have been previously developed when arm distributions are restricted to a single parameter exponential family. In this paper, we first observe a negative result that some restrictions are essential, as otherwise, under a $δ$-correct algorithm, distributions with unbounded support would require an infinite number of samples in expectation. We then propose a $δ$-correct algorithm that matches the lower bound as $δ$ reduces to zero under the mild restriction that a known bound on the expectation of $(1+ε)^{th}$ moment of the underlying random variables exists, for $ε> 0$. We also propose batch processing and identify near-optimal batch sizes to speed up the proposed algorithm substantially. The best-arm problem has many learning applications, including recommendation systems and product selection. It is also a well-studied classic problem in the simulation community.

研究の動機と目的

  • 指数型分布族を超える一般の重たい尾を持つ分布に対して、最適なδ-正しいアルゴリズムが存在しないという問題を解決する。
  • モーメント制約がなければ、δ-正しいアルゴリズムが無限の期待サンプル数を必要とするため、分布に関する仮定が不可欠であることを確立する。
  • わずかな(1+ε)次のモーメント条件の下で、δ→0のとき情報理論的下界に一致するδ-正しいアルゴリズムを提案する。
  • 探索と収束速度のバランスを取るために、log(1/δ)に比例するバッチサイズを最適化したバッチ処理技術を開発する。
  • Lévy距離を用いた再考された、よりきつい集中度分析により、先行研究における技術的誤りを是正する。

提案手法

  • よりきつい集中不等式を導出するため、Wasserstein距離の代わりにLévy距離を用いる。
  • ε>0に対して、(1+ε)次の絶対モーメントが有界であるすべての分布からなる分布族Lを定義する。
  • 経験的平均と信頼区間に基づいて、プルの割り当てを段階的に適応的に制御する逐次的サンプリングアルゴリズムを設計する。
  • バッチ処理を導入し、サンプリング意思決定をバッチ単位で行い、計算オーバーヘッドを低減する。
  • 探索と収束速度のバランスを取るために、バッチサイズをlog(1/δ)に比例させる。
  • マルティンゲール制約下で、バッチ間のサンプリング割合の逸脱をAzuma-Hoeffding不等式で制限する。

実験結果

リサーチクエスチョン

  • RQ1δ-正しい最良腕特定において、有限な期待サンプル複雑度を保証するためには、どのような分布的制約が必要か?
  • RQ2有限な(1+ε)次のモーメントを持つ重たい尾を持つ分布に対して、δ-正しいアルゴリズムが漸近的最適性を達成できるか?
  • RQ3バッチ処理は、漸近的最適性を維持しながら計算効率を向上させることができるか?
  • RQ4この問題における集中度分析において、Wasserstein距離とLévy距離を用いることで生じる違いは何か?
  • RQ5先行研究における技術的誤り、特に集中不等式と測度変更解析に関する誤りは、どのように是正できるか?

主な発見

  • サポートが有界でない、およびKL右密性を持つ分布に対しては、任意のδ-正しいアルゴリズムが無限の期待サンプル数を必要とするため、モーメント制約なしでは根本的に不可能であることが示された。
  • 提案されたアルゴリズムは、(1+ε)次のモーメント条件の下でδ→0のとき、サンプル複雑度において漸近的最適性を達成し、情報理論的下界に一致する。
  • log(1/δ)に比例するバッチサイズを用いたバッチ処理により、計算コストが低減されつつ、漸近的最適性が保持される。
  • Lévy距離の使用により、よりきつい集中不等式が得られ、Wasserstein距離を用いた先行研究における誤りが是正された。
  • アルゴリズムの誤差確率はδで抑えられ、期待サンプル複雑度は対数因子を除いて下界と一致する。
  • 数値解析により、バッチ処理を施したバージョンが、δ-正しい性質や漸近的最適性を損なわず、実行時間を顕著に短縮することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。