Skip to main content
QUICK REVIEW

[論文レビュー] Exploring $k$ out of Top $ρ$ Fraction of Arms in Stochastic Bandits

Wenbo Ren, Jia Liu|arXiv (Cornell University)|Oct 28, 2018
Advanced Bandit Algorithms Research被引用数 7
ひとこと要約

この論文は、PAC保証下で期待報酬の上位 $\rho$ 分率に属する $k$ アームを特定する、ステochasticなマルチアームバンディットにおける新しい分位数探索(QE)フレームワークを導入する。既知および未知のしきい値の両方の設定に対してアルゴリズムを提案し、定数要因または対数的要因の範囲でサンプル複雑性が最適化され、従来の $k$-探索手法と比較して最大 $\rho n/k$ の削減を達成する。

ABSTRACT

This paper studies the problem of identifying any $k$ distinct arms among the top $ρ$ fraction (e.g., top 5\%) of arms from a finite or infinite set with a probably approximately correct (PAC) tolerance $ε$. We consider two cases: (i) when the threshold of the top arms' expected rewards is known and (ii) when it is unknown. We prove lower bounds for the four variants (finite or infinite arms, and known or unknown threshold), and propose algorithms for each. Two of these algorithms are shown to be sample complexity optimal (up to constant factors) and the other two are optimal up to a log factor. Results in this paper provide up to $ρn/k$ reductions compared with the "$k$-exploration" algorithms that focus on finding the (PAC) best $k$ arms out of $n$ arms. We also numerically show improvements over the state-of-the-art.

研究の動機と目的

  • 大規模または無限のアーム集合において従来の $k$-探索の限界を克服し、絶対的な上位 $k$ アームではなく、上位分位数に属するアームに焦点を当てる。
  • アーム総数 $n$ に依存するサンプル複雑性を低減するため、$k/\rho$ に置き換えることで、大規模応用におけるスケーラビリティを向上させる。
  • 既知および未知のしきい値設定下で、有限および無限のアーム集合に対して、PAC許容誤差 $\epsilon$ の下での純粋探索問題を考察する。
  • 理論的下界を導出し、それらの下界に一致またはほぼ一致するサンプル複雑性を達成するアルゴリズムを設計する。

提案手法

  • 上位 $\rho$ 分率の期待報酬に属する $k$ アームを特定することを目的とする、$k$-探索の緩和版として分位数探索(QE)問題を提案する。
  • 既知のしきい値 $\lambda_\rho$ 用の CB-AL-Q-IK および未知のしきい値用の CB-AL-Q-IU の2つのアルゴリズム変種を導入し、信頼区間とアームの排除を用いる。
  • 上界と下界の信頼区間に基づいた適応的サンプリングとプルーニングを実行する CBB(信頼区間ベース)フレームワークを採用する。
  • 上位 $\rho$ 分率のためのしきい値を定義するために、逆累積分布関数 $\mathcal{F}^{-1}(\rho)$ を用い、分位数に基づくアーム選択を可能にする。
  • 2段階のサンプリング戦略を適用:まず、高い信頼性でアームの平均を推定し、次に、分位数しきい値未満のアームを除外する。
  • 未知のしきい値の場合、信頼区間を用いた逐次的排除手順(LE)により、候補を段階的に絞り込む。

実験結果

リサーチクエスチョン

  • RQ1上位 $k$ アームではなく上位 $\rho$ 分率に属するアームをターゲットにすることで、純粋探索バンディットにおけるサンプル複雑性を低減できるか?
  • RQ2既知および未知のしきい値設定下で、上位 $\rho$ 分率に属する $k$ アームを特定するためのサンプル複雑性の理論的下界は何か?
  • RQ3提案されたアルゴリズムのサンプル複雑性は、$n$、$k$、$\rho$、$\epsilon$ に依存する点で、従来の $k$-探索手法と比較してどのように異なるか?
  • RQ4有限および無限のアーム集合において、QEフレームワークでサンプル複雑性の最適性(定数要因または対数的要因の範囲)を達成できるか?

主な発見

  • 提案された CB-AL-Q-IK アルゴリズムは、既知のしきい値の有限アームケースにおいて、定数要因の範囲でサンプル複雑性が最適化される。
  • 未知のしきい値の有限アームケースでは、CB-AL-Q-IU が $\log k$ 要因の範囲でサンプル複雑性が最適化される。
  • QE問題のサンプル複雑性は、従来の $k$-探索と比較して最大 $\rho n/k$ まで低減され、特に $\rho$ が小さい場合に顕著に効果的である。
  • 数値実験の結果、CB-AL-Q-IK はすべてのテスト設定で KL-LUCB を上回り、特に $\rho$ が小さい場合に顕著に低いサンプル数を達成する。
  • $\rho$ が小さい場合、$\frac{1}{\rho}\log\frac{1}{\rho}$ 項が $\log\frac{1}{\delta}$ を支配するため、アルゴリズムのサンプル数は $\delta$ にほぼ依存しない。
  • 大きな $k$ の場合、CB-AL-Q-IU は $k\log k$ の依存性を示すのに対し、KL-LUCB は $k\log^2 k$ のスケーリングを示すため、明確な優位性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。