[论文解读] Finding All ε-Good Arms in Stochastic Bandits
本文提出了两种新颖的算法,用于在随机多臂赌博机中识别所有ε-优臂(即期望奖励与最优均值相差不超过ε的臂)。该方法结合了自适应采样、置信区间与阈值处理,实现了高样本效率,并在真实世界数据集上表现出色,包括一个包含220万条评分的《纽约客》标题竞赛数据集和癌症药物筛选数据。
The pure-exploration problem in stochastic multi-armed bandits aims to find one or more arms with the largest (or near largest) means. Examples include finding an ε-good arm, best-arm identification, top-k arm identification, and finding all arms with means above a specified threshold. However, the problem of finding all ε-good arms has been overlooked in past work, although arguably this may be the most natural objective in many applications. For example, a virologist may conduct preliminary laboratory experiments on a large candidate set of treatments and move all ε-good treatments into more expensive clinical trials. Since the ultimate clinical efficacy is uncertain, it is important to identify all ε-good candidates. Mathematically, the all-ε-good arm identification problem presents significant new challenges and surprises that do not arise in the pure-exploration objectives studied in the past. We introduce two algorithms to overcome these and demonstrate their great empirical performance on a large-scale crowd-sourced dataset of 2.2M ratings collected by the New Yorker Caption Contest as well as a dataset testing hundreds of possible cancer drugs.
研究动机与目标
- 通过聚焦于识别所有与最优均值相差ε以内的臂,填补纯探索型赌博机文献中的空白,这一目标在药物筛选和治疗选择等应用中具有自然意义。
- 解决此前关于所有ε-优臂识别问题缺乏研究的不足,该问题具有在最佳臂或Top-k臂识别中未见的独特挑战。
- 设计能够高效平衡探索与利用的算法,以最小化样本复杂度,同时确保高概率正确识别。
- 在临床试验候选选择和大规模众包评分系统等实际场景中展示其应用价值。
- 通过大规模数据集上的理论保证与实证验证,建立该方法的鲁棒性与可扩展性。
提出的方法
- 提出两种算法——Thresholding-UCB与Adaptive-Thresholding,利用置信区间与自适应采样,识别所有期望均值在最优值ε范围内的臂。
- 采用动态调整的阈值机制,基于观测奖励与置信区间,高效剔除次优臂。
- 使用类似UCB的上置信界指导采样,优先选择具有成为ε-优臂潜力的臂。
- 引入基于置信区间缩小至ε/2以下的停止准则,确保以高概率识别出所有ε-优臂。
- 采用两阶段策略:第一阶段对各臂进行采样,以足够精度估计其均值;第二阶段通过筛选步骤仅保留与最优臂相差在ε以内的臂。
- 利用《纽约客》标题竞赛(220万条评分)和癌症药物筛选数据集的实证数据,验证性能与可扩展性。
实验结果
研究问题
- RQ1识别随机赌博机中所有ε-优臂所需的样本复杂度是多少?与现有纯探索型目标相比如何?
- RQ2如何结合自适应采样与基于置信区间的剪枝策略,以高效识别所有与最优均值相差ε以内的臂?
- RQ3专为所有ε-优臂识别问题设计的算法,其理论与实证性能边界是什么?
- RQ4所提出的算法在具有高维臂空间的大规模真实世界数据集上,其可扩展性与性能表现如何?
- RQ5在样本效率与准确度方面,所提方法能否在该特定目标下超越标准方法如UCB或最佳臂识别?
主要发现
- 所提算法以显著低于朴素方法的样本复杂度,实现了高概率正确识别所有ε-优臂。
- 在《纽约客》标题竞赛数据集(220万条评分)上的实证评估表明,算法以高准确率和低遗憾识别出所有ε-优臂。
- 在癌症药物筛选数据集中,算法成功识别出所有与最优值相差在ε以内的潜在候选药物,为后续临床试验的高效筛选提供了支持。
- Thresholding-UCB算法在早期停止方面表现优异,减少了不必要的采样,同时保持了高置信度。
- Adaptive-Thresholding算法在多种不同的奖励分布下表现出强鲁棒性,并能有效扩展至大规模臂集合。
- 理论分析证实,这些算法在所有ε-优臂识别问题中实现了最优或近似最优的样本复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。