[论文解读] Practical Algorithms for Best-K Identification in Multi-Armed Bandits
本文提出了两种实用的算法,lil'RandLUCB 和 lil'CLUCB,用于多臂赌博机中的最佳-K 识别问题,利用有限时域重对数律(LIL)置信区间,实现近乎最优的样本复杂度。这些算法在对数因子范围内匹配理论下界,并在实践中优于现有方法,尤其在臂的数量增加时表现更优。
In the Best-$K$ identification problem (Best-$K$-Arm), we are given $N$ stochastic bandit arms with unknown reward distributions. Our goal is to identify the $K$ arms with the largest means with high confidence, by drawing samples from the arms adaptively. This problem is motivated by various practical applications and has attracted considerable attention in the past decade. In this paper, we propose new practical algorithms for the Best-$K$-Arm problem, which have nearly optimal sample complexity bounds (matching the lower bound up to logarithmic factors) and outperform the state-of-the-art algorithms for the Best-$K$-Arm problem (even for $K=1$) in practice.
研究动机与目标
- 填补多臂赌博机中最佳-K 识别问题在理论上最优与实际高效算法之间的差距。
- 设计样本复杂度在对数因子范围内匹配理论下界的算法。
- 在大规模问题(尤其是臂的数量众多时)中,改进现有方法的实际性能。
- 将所提算法推广至组合纯探索(CPE)设置,并实现改进的样本复杂度。
提出的方法
- 算法使用与时间无关的基于 LIL 的置信区间,而非标准的 UCB 风格边界,以减少过度采样。
- lil'RandLUCB 从当前候选集或其补集中选择置信半径最大的臂,确保高效探索。
- lil'CLUCB 为所有臂维护上下置信边界,并在具有最高经验均值的臂集合与具有最高下置信边界的臂集合一致时停止。
- 理论分析使用集中不等式和一种新颖的停止条件论证,以界定向样本复杂度。
- 通过将寻找最佳-K 臂的预言机替换为对组合结构的一般预言机,将算法推广至组合纯探索(CPE)设置。
- 关键技术突破在于使用来自 LIL 的固定置信半径,避免了先前界中出现的 $O(H\log H)$ 项。
实验结果
研究问题
- RQ1我们能否设计一种最佳-K 赌博机算法,实现近乎最优的样本复杂度和强大的实际性能?
- RQ2与标准 UCB 或基于消除的方法相比,基于 LIL 的置信区间如何提升实际效率?
- RQ3基于 LIL 的方法能否推广至组合纯探索,并在保证样本复杂度的前提下提供理论保证?
- RQ4置信半径的选择对实现高置信度识别所需样本数有何影响?
主要发现
- 所提出的 lil'RandLUCB 和 lil'CLUCB 算法的样本复杂度为 $O\left(\sum_{i\in\mathcal{I}}\Delta_{i}^{-2}(\log\delta^{-1} + \log N + \log\log\Delta_{i}^{-1})\right)$,在对数因子范围内匹配理论下界。
- lil'RandLUCB 显著减少了所需样本数,尤其在高维设置(即臂的数量众多)中表现更优。
- 该算法在多个基准测试中优于最先进的 lil'LUCB(用于最佳-1 臂问题),展现出更优越的实际性能。
- 推广后的 lil'CLUCB 在组合纯探索(CPE)中实现了改进的样本复杂度,其界为 $O\left(\text{OPT}(\mathcal{M})^2\sigma^2\sum_{i\in\mathcal{I}}\Delta_{i}^{-2}(\log\delta^{-1} + \log N + \log\log\Delta_{i}^{-1})\right)$。
- 理论分析确认,算法以至少 $1 - c_\epsilon \delta^{1+\epsilon}/N^\epsilon$ 的概率返回正确解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。