Skip to main content
QUICK REVIEW

[論文レビュー] Pure Exploration in Infinitely-Armed Bandit Models with Fixed-Confidence

Maryam Aziz, Jesse Anderton|arXiv (Cornell University)|Mar 13, 2018
Advanced Bandit Algorithms Research参考文献 14被引用数 6
ひとこと要約

本稿は、貯留分布を伴う無限に腕の多いバンディット問題に対して、固定信頼度の純探索フレームワークを導入し、高い確率でほぼ最適な腕を特定するアルゴリズムを提案する。サンプル複雑度の下界を確立し、上界を対数要因の範囲で証明することで、この設定における二段階アルゴリズムにおいて、log²(1/δ) の依存関係が避けがたい可能性があることを示している。

ABSTRACT

We consider the problem of near-optimal arm identification in the fixed confidence setting of the infinitely armed bandit problem when nothing is known about the arm reservoir distribution. We (1) introduce a PAC-like framework within which to derive and cast results; (2) derive a sample complexity lower bound for near-optimal arm identification; (3) propose an algorithm that identifies a nearly-optimal arm with high probability and derive an upper bound on its sample complexity which is within a log factor of our lower bound; and (4) discuss whether our log^2(1/delta) dependence is inescapable for "two-phase" (select arms first, identify the best later) algorithms in the infinite setting. This work permits the application of bandit models to a broader class of problems where fewer assumptions hold.

研究の動機と目的

  • 腕の貯留分布に関する最小限の仮定の下で、無限に腕の多いバンディット問題におけるほぼ最適な腕の特定に取り組む。
  • 無限の設定における固定信頼度の純探索のためのPACに類似したフレームワークを構築し、トップ-αおよびε-緩和された識別を両方対応可能にする。
  • 高い確率でほぼ最適な腕を特定するためのサンプル複雑度の下界を導出する。
  • 下界の対数要因の範囲内で上界を持つサンプル複雑度を持つアルゴリズムを設計する。
  • 二段階アルゴリズムにおいて、log²(1/δ) の依存関係が無限バンディット設定で避けがたいかどうかを調査する。

提案手法

  • 確率1−δ以上で貯留分布の上位α分率に属する腕を特定できる、新しい$(\alpha,\delta)$フレームワークを導入する。
  • 上位α境界付近に密度の高い確率質量を持つ貯留分布を扱うために、$\epsilon$-緩和フレームワークを提案する。これにより実用的妥当性が向上する。
  • 二段階アルゴリズムを設計する:第一段階では報酬を観測せずに貯留分布から腕をサンプリングする。第二段階では、事前に選択された腕の報酬をサンプリングし、最良の腕を特定する。
  • チェルノフ情報とKLダイバージェンスを用いて、腕の平均値の差を評価し、信頼度に基づく腕選択を可能にする。
  • サンプル複雑度の上界を導出し、$\mathcal{O}\left(\left(\frac{4}{\epsilon^2} + \sum_{i=2}^{m-1} \frac{1}{d^*(b_i,b_1)}\right)\log^2\frac{1}{\delta}\right)$ のスケーリングを示す。
  • サンプル複雑度の下界を証明し、$\log\frac{1}{\delta}$ を含むものであり、上界が最適性の対数要因の範囲にあることを示す。

実験結果

リサーチクエスチョン

  • RQ1二段階アルゴリズムにおいて、無限バンディット設定で $\log^2\frac{1}{\delta}$ のサンプル複雑度依存関係は避けがたいか?
  • RQ2$\epsilon$-緩和フレームワークは、上位α閾値付近に密度の高い質量を持つ貯留分布において、ロバストネスを向上させられるか?
  • RQ3提案されたアルゴリズムのサンプル複雑度は、$\delta$ に関する理論的下界と比較してどの程度の依存関係を示すか?
  • RQ4貯留分布の尾部挙動が純探索のサンプル複雑度に及ぼす影響は何か?
  • RQ5一括段階アルゴリズムは、サンプリングと選択をインタリーブすることで、$\log^2\frac{1}{\delta}$ 要因を回避できるか?

主な発見

  • ほぼ最適な腕の特定のためのサンプル複雑度下界は、$\Omega\left(\left(\frac{1}{d(b_1-\epsilon,b_0+\epsilon)} + \sum_{i=3}^{m-1}\frac{1}{d(b_i,b_0+\epsilon)}\right)\log\frac{1}{\delta}\right)$ にスケーリングする。ここで $d$ はKLダイバージェンスである。
  • 提案されたアルゴリズムは、$\mathcal{O}\left(\left(\frac{4}{\epsilon^2} + \sum_{i=2}^{m-1}\frac{1}{d^*(b_i,b_1)}\right)\log^2\frac{1}{\delta}\right)$ の上界を達成し、下界の対数要因の範囲内にある。
  • log²(1/δ) 要因は、二段階アルゴリズムの両段階でδ-正しい性質を満たす必要があることから生じており、このようなアプローチでは避けがたい可能性がある。
  • ベルヌーイケースでは、KLダイバージェンス $d(x,\mu^*)$ とチェルノフ情報 $d^*(x,\mu^*)$ は同程度のスケールであり、非最適な腕に対しては $d^*(x,\mu^*)$ がわずかに $d(x,\mu^*)$ より小さい。
  • 第一段階では、高い確率で上位αの腕を特定するため、少なくとも $\Omega\left(\frac{1}{\alpha}\log\frac{1}{\delta}\right)$ のサンプルが必要であり、貯留サンプリングの根本的なコストを示している。
  • 著者らは、一括段階アルゴリズムが $\log\frac{1}{\delta}$ 依存関係を達成できるかもしれないと仮説を立てており、より高い効率への道筋を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。