Skip to main content
QUICK REVIEW

[論文レビュー] Towards Instance Optimal Bounds for Best Arm Identification

Lijie Chen, Jian Li|arXiv (Cornell University)|Aug 22, 2016
Advanced Bandit Algorithms Research参考文献 21被引用数 15
ひとこと要約

この論文は、ベストアーム同定におけるギャップエントロピー予想に大きな進展をもたらし、対数要因を除いてインスタンス最適なサンプル複雑度を達成する新しいアルゴリズムを提示することで、その解決に向けた重要な一歩を踏み出した。ガウス分布のインスタンスに対してタイトな下界を証明し、インスタンス依存の複雑度が $ H(I) \cdot (\ln \delta^{-1} + \mathsf{Ent}(I)) $ にタイトに特徴づけられることを示した。これにより、長年の未解決問題であったベスト1アーム問題における最適サンプル複雑度の解明に、ほぼ完全に近い解決に至った。

ABSTRACT

In the classical best arm identification (Best-$1$-Arm) problem, we are given $n$ stochastic bandit arms, each associated with a reward distribution with an unknown mean. We would like to identify the arm with the largest mean with probability at least $1-δ$, using as few samples as possible. Understanding the sample complexity of Best-$1$-Arm has attracted significant attention since the last decade. However, the exact sample complexity of the problem is still unknown. Recently, Chen and Li made the gap-entropy conjecture concerning the instance sample complexity of Best-$1$-Arm. Given an instance $I$, let $μ_{[i]}$ be the $i$th largest mean and $Δ_{[i]}=μ_{[1]}-μ_{[i]}$ be the corresponding gap. $H(I)=\sum_{i=2}^nΔ_{[i]}^{-2}$ is the complexity of the instance. The gap-entropy conjecture states that $Ω\left(H(I)\cdot\left(\lnδ^{-1}+\mathsf{Ent}(I) ight) ight)$ is an instance lower bound, where $\mathsf{Ent}(I)$ is an entropy-like term determined by the gaps, and there is a $δ$-correct algorithm for Best-$1$-Arm with sample complexity $O\left(H(I)\cdot\left(\lnδ^{-1}+\mathsf{Ent}(I) ight)+Δ_{[2]}^{-2}\ln\lnΔ_{[2]}^{-1} ight)$. If the conjecture is true, we would have a complete understanding of the instance-wise sample complexity of Best-$1$-Arm. We make significant progress towards the resolution of the gap-entropy conjecture. For the upper bound, we provide a highly nontrivial algorithm which requires \[O\left(H(I)\cdot\left(\lnδ^{-1} +\mathsf{Ent}(I) ight)+Δ_{[2]}^{-2}\ln\lnΔ_{[2]}^{-1}\mathrm{polylog}(n,δ^{-1}) ight)\] samples in expectation. For the lower bound, we show that for any Gaussian Best-$1$-Arm instance with gaps of the form $2^{-k}$, any $δ$-correct monotone algorithm requires $Ω\left(H(I)\cdot\left(\lnδ^{-1} + \mathsf{Ent}(I) ight) ight)$ samples in expectation.

研究の動機と目的

  • ギャップエントロピー予想を解決すること。これは、ベスト1アーム問題における最適サンプル複雑度が $ \Omega(H(I) \cdot (\ln \delta^{-1} + \mathsf{Ent}(I))) $ であると仮定し、一致する上界を示すこと。
  • すべての問題インスタンスにおいて、インスタンス最適なサンプル複雑度を達成する新しいアルゴリズムを設計すること。これは、すべてのインスタンスにおいて期待されるサンプル数を最小化することを目的とする。
  • ガウス分布のベストアーム同定における単調アルゴリズムに対して、ほぼタイトな下界を確立すること。これにより、複雑度にエントロピー項が必要であることが確認される。
  • ギャップ構造とエントロピーに類似した項が、マルチアームバンディットにおける純粋な探索の根本的限界に与える影響を理解すること。

提案手法

  • 推定されたギャップと信頼区間に基づいて動的にサンプリングを調整する新しいアダプティブサンプリングアルゴリズムを提案。エリミネーションと分数テスト戦略を統合。
  • 誤差伝搬を制御し、$ \delta $-正しくなることを保証するため、再帰的ラウンドとしきい値処理を用いた新しい解析フレームワークを導入。
  • ギャップの大きさに基づいてアームをグループに再帰的に分解し、各グループに個別のサンプリング予算を割り当てることで、探索と信頼性のバランスを取る。
  • 下界解析を簡素化するため、単調性仮定を用い、劣悪なアームを除去して得られる部分インスタンスに焦点を当てる。
  • 集中不等式とラウンド間の和集合不等式を用いて失敗確率を制御し、対数的および多対数的項を丁寧に取り扱う。
  • 指数的に減少するギャップを持つ一連の部分インスタンスへの還元を用いて下界を確立。これにより、$ \Omega(H(I) \cdot (\ln \delta^{-1} + \mathsf{Ent}(I))) $ のサンプル数が必要であることが示された。

実験結果

リサーチクエスチョン

  • RQ1ギャップエントロピー予想は真か。すなわち、最適サンプル複雑度が $ \Omega(H(I) \cdot (\ln \delta^{-1} + \mathsf{Ent}(I))) $ のスケーリングに従うか?
  • RQ21つのアルゴリズムが、対数要因を除いて、すべてのバンディットインスタンスにおいてインスタンス最適な性能を達成できるか?
  • RQ3ガウス分布のベストアーム同定において、任意の $ \delta $-正しく単調なアルゴリズムが期待して少なくとも何サンプル必要か?
  • RQ4ギャップ構造とエントロピーに類似した項 $ \mathsf{Ent}(I) $ が、純粋な探索の根本的限界に与える影響は何か?

主な発見

  • 提案されたアルゴリズムは、期待されるサンプル複雑度が $ O\left(H(I) \cdot (\ln \delta^{-1} + \mathsf{Ent}(I)) + \Delta_{[2]}^{-2} \ln \ln \Delta_{[2]}^{-1} \cdot \mathrm{polylog}(n, \delta^{-1})\right) $ に抑えられることを示した。
  • ギャップが $ 2^{-k} $ の形をとる任意のガウス分布のベストアームインスタンスにおいて、任意の $ \delta $-正しく単調なアルゴリズムは、期待して少なくとも $ \Omega(H(I) \cdot (\ln \delta^{-1} + \mathsf{Ent}(I))) $ のサンプル数を必要とする。
  • 下界は、推定されたインスタンス最適な形と定数要因を除いて一致し、複雑度にエントロピー項が必要であることが確認された。
  • 上界は、2アームインスタンスにおける既知の複雑度 $ \Theta(\Delta_{[2]}^{-2} \ln \ln \Delta_{[2]}^{-1}) $ と一致し、最小ケースにおけるアルゴリズムの振る舞いが妥当であることが検証された。
  • 解析により、ギャップエントロピー予想はほぼ解決されたと判明。上界に残っている唯一のギャップは、$ \mathrm{polylog}(n, \delta^{-1}) $ 要因である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。