Skip to main content
QUICK REVIEW

[论文解读] Pure Exploration in Infinitely-Armed Bandit Models with Fixed-Confidence

Maryam Aziz, Jesse Anderton|arXiv (Cornell University)|Mar 13, 2018
Advanced Bandit Algorithms Research参考文献 14被引用 6
一句话总结

本文提出了一种针对具有蓄水池分布的无限臂多臂赌博机问题的固定置信度纯探索框架,设计了一种算法,能够在高概率下识别出近似最优的臂。该研究建立了样本复杂度的下界,并证明了上界与下界仅相差一个对数因子,表明在此设定下,对于两阶段算法而言,log²(1/δ) 的依赖关系可能不可避免。

ABSTRACT

We consider the problem of near-optimal arm identification in the fixed confidence setting of the infinitely armed bandit problem when nothing is known about the arm reservoir distribution. We (1) introduce a PAC-like framework within which to derive and cast results; (2) derive a sample complexity lower bound for near-optimal arm identification; (3) propose an algorithm that identifies a nearly-optimal arm with high probability and derive an upper bound on its sample complexity which is within a log factor of our lower bound; and (4) discuss whether our log^2(1/delta) dependence is inescapable for "two-phase" (select arms first, identify the best later) algorithms in the infinite setting. This work permits the application of bandit models to a broader class of problems where fewer assumptions hold.

研究动机与目标

  • 在对臂蓄水池分布的假设最少的前提下,解决无限臂多臂赌博机问题中近似最优臂的识别问题。
  • 为无限设定下的固定置信度纯探索构建类似PAC的框架,同时适用于top-α和ε-松弛识别。
  • 推导出以高概率识别近似最优臂的样本复杂度下界。
  • 设计一种样本复杂度上界与下界仅相差一个对数因子的算法。
  • 探究在无限赌博机设定下,两阶段算法中log²(1/δ)依赖关系是否不可避免。

提出的方法

  • 引入一种新颖的$(\alpha,\delta)$-框架,以至少1−δ的概率识别出蓄水池中排名前α的臂。
  • 提出一种$\epsilon$-松弛框架,以处理在top-α边界附近存在密集概率质量的蓄水池,提升实际适用性。
  • 设计一种两阶段算法:第一阶段,从蓄水池中采样臂但不观察奖励;第二阶段,从先前选定的臂中采样奖励,以识别最优臂。
  • 利用切尔诺夫信息和KL散度来界定臂均值之间的分离度,从而实现基于置信度的臂选择。
  • 推导出样本复杂度的上界,其量级为$\mathcal{O}\left(\left(\frac{4}{\epsilon^2} + \sum_{i=2}^{m-1} \frac{1}{d^*(b_i,b_1)}\right)\log^2\frac{1}{\delta}\right)$。
  • 证明了样本复杂度的下界涉及$\log\frac{1}{\delta}$,表明上界与最优性仅相差一个对数因子。

实验结果

研究问题

  • RQ1在无限赌博机设定下,两阶段算法中样本复杂度对$\log^2\frac{1}{\delta}$的依赖是否不可避免?
  • RQ2在top-α阈值附近存在密集质量的蓄水池中,$\epsilon$-松弛框架是否能提升鲁棒性?
  • RQ3所提算法的样本复杂度与理论下界在$\delta$依赖关系上的比较如何?
  • RQ4蓄水池分布的尾部行为对纯探索样本复杂度有何影响?
  • RQ5通过交错采样与选择,单阶段算法是否可避免$\log^2\frac{1}{\delta}$因子?

主要发现

  • 近似最优臂识别的样本复杂度下界为$\Omega\left(\left(\frac{1}{d(b_1-\epsilon,b_0+\epsilon)} + \sum_{i=3}^{m-1}\frac{1}{d(b_i,b_0+\epsilon)}\right)\log\frac{1}{\delta}\right)$,其中$d$为KL散度。
  • 所提算法的上界为$\mathcal{O}\left(\left(\frac{4}{\epsilon^2} + \sum_{i=2}^{m-1}\frac{1}{d^*(b_i,b_1)}\right)\log^2\frac{1}{\delta}\right)$,与下界仅相差一个对数因子。
  • $\log^2\frac{1}{\delta}$因子源于两阶段算法在两个阶段均需满足$\delta$-正确性,表明此类方法中该因子可能不可避免。
  • 在伯努利情况下,KL散度$d(x,\mu^*)$与切尔诺夫信息$d^*(x,\mu^*)$量级相近,且对非最优臂而言,$d^*(x,\mu^*)$略小于$d(x,\mu^*)$。
  • 第一阶段至少需要$\Omega\left(\frac{1}{\alpha}\log\frac{1}{\delta}\right)$次采样,才能以高概率识别出top-α臂,表明蓄水池采样存在根本性成本。
  • 作者推测单阶段算法可能实现$\log\frac{1}{\delta}$依赖关系,提示存在提升效率的潜在路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。