[论文解读] Exploring $k$ out of Top $ρ$ Fraction of Arms in Stochastic Bandits
本文提出了一种用于随机多臂老虎机的新型分位数探索(QE)框架,在PAC保证下识别出在期望奖励中处于前ρ分数内的k个臂。该框架针对已知和未知阈值提出了算法,其样本复杂度在常数或对数因子范围内达到最优,相较于传统k-探索方法,样本复杂度最高可降低ρn/k。
This paper studies the problem of identifying any $k$ distinct arms among the top $ρ$ fraction (e.g., top 5\%) of arms from a finite or infinite set with a probably approximately correct (PAC) tolerance $ε$. We consider two cases: (i) when the threshold of the top arms' expected rewards is known and (ii) when it is unknown. We prove lower bounds for the four variants (finite or infinite arms, and known or unknown threshold), and propose algorithms for each. Two of these algorithms are shown to be sample complexity optimal (up to constant factors) and the other two are optimal up to a log factor. Results in this paper provide up to $ρn/k$ reductions compared with the "$k$-exploration" algorithms that focus on finding the (PAC) best $k$ arms out of $n$ arms. We also numerically show improvements over the state-of-the-art.
研究动机与目标
- 为解决传统k-探索在大规模或无限臂集中的局限性,通过聚焦于识别处于前分位数而非绝对最优k个臂来改进。
- 通过用k/ρ替代n(总臂数)来减少样本复杂度对n的依赖,从而在大规模应用中实现可扩展性。
- 研究在已知和未知阈值下,针对有限和无限臂集的PAC容差ε下的纯探索问题。
- 推导理论下界,并设计在样本复杂度上匹配或近乎匹配这些下界的算法。
提出的方法
- 将分位数探索(QE)问题作为k-探索的松弛形式提出,目标是找到期望奖励处于前ρ分数内的k个臂。
- 提出两种算法变体:CB-AL-Q-IK(用于已知阈值λ_ρ)和CB-AL-Q-IU(用于未知阈值),结合置信区间与臂消除策略。
- 采用基于置信区间的(CBB)框架,通过上界和下界置信区间实现自适应采样与剪枝。
- 使用分位数的逆累积分布函数$\mathcal{F}^{-1}(\rho)$定义前ρ分数的阈值,实现基于分位数的臂选择。
- 采用两阶段采样策略:第一阶段,以高置信度估计臂的均值;第二阶段,剔除低于分位数阈值的臂。
- 对于未知阈值情况,采用基于置信区间的顺序消除程序(LE),逐步缩小候选臂集合。
实验结果
研究问题
- RQ1我们能否通过聚焦于前ρ分数内的臂而非前k个臂,来降低纯探索老虎机的样本复杂度?
- RQ2在已知和未知阈值设置下,识别处于前ρ分数内的k个臂的样本复杂度理论下界是什么?
- RQ3所提算法的样本复杂度与现有k-探索方法相比,在n、k、ρ和ε上的依赖关系如何?
- RQ4我们能否在QE框架下,针对有限和无限臂集均实现样本复杂度最优(至多常数或对数因子)?
主要发现
- 所提出的CB-AL-Q-IK算法在已知阈值的有限臂情况下,样本复杂度达到常数因子范围内的最优。
- 在未知阈值的有限臂情况下,CB-AL-Q-IU的样本复杂度达到log k因子范围内的最优。
- 与传统k-探索相比,QE问题的样本复杂度最高可降低ρn/k,尤其在ρ较小时优势显著。
- 数值结果表明,CB-AL-Q-IK在所有测试设置下均优于KL-LUCB,样本数量显著更低,尤其在ρ较小时表现更优。
- 当ρ较小时,由于$\frac{1}{\rho}\log\frac{1}{\rho}$项主导了$\log\frac{1}{\delta}$,算法的样本数量几乎与δ无关。
- 当k较大时,CB-AL-Q-IU相较于KL-LUCB展现出明显优势,因其依赖关系为k log k,而KL-LUCB为k log²k。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。