[论文解读] Nearly Instance Optimal Sample Complexity Bounds for Top-k Arm Selection
本文提出了一种基于消除的新型算法,用于随机多臂赌博机中的Best-k-Arm问题,实现了近乎实例最优的样本复杂度。通过从Best-1-Arm问题出发的非平凡约化,建立了新的实例化下界,并证明该算法的样本复杂度与该下界在双对数因子内匹配,严格优于此前方法(常数因子范围内)。
In the Best-$k$-Arm problem, we are given $n$ stochastic bandit arms, each associated with an unknown reward distribution. We are required to identify the $k$ arms with the largest means by taking as few samples as possible. In this paper, we make progress towards a complete characterization of the instance-wise sample complexity bounds for the Best-$k$-Arm problem. On the lower bound side, we obtain a novel complexity term to measure the sample complexity that every Best-$k$-Arm instance requires. This is derived by an interesting and nontrivial reduction from the Best-$1$-Arm problem. We also provide an elimination-based algorithm that matches the instance-wise lower bound within doubly-logarithmic factors. The sample complexity of our algorithm strictly dominates the state-of-the-art for Best-$k$-Arm (module constant factors).
研究动机与目标
- 为随机赌博机中的Best-k-Arm问题提供实例化样本复杂度的完整表征。
- 通过将Best-k-Arm问题约化为Best-1-Arm问题,建立新的、更紧致的样本复杂度下界。
- 设计一种基于消除的算法,使其样本复杂度在双对数因子内匹配实例化下界。
- 在样本复杂度方面超越当前最先进方法,严格优于先前方法(常数因子范围内)。
提出的方法
- 通过从Best-1-Arm问题出发的非平凡约化,推导出新的实例化下界,假设奖励服从单位方差的高斯分布。
- 基于差距大小对臂进行分组:$ G^{ extsf{large}}_r $ 和 $ G^{ extsf{small}}_r $,其中差距位于 $ (C2^{-r-1}, 2^{-r}] $ 区间内。
- 提出一种基于消除的算法,自适应地采样臂,通过依赖差距的采样策略,专注于区分前k名臂与其余臂。
- 使用类似调和级数的和 $ H = \sum_{i=1}^\infty \varepsilon_i^{-2} (|G^{ extsf{large}}_i| + |G^{ extsf{small}}_i|) $ 分析样本复杂度,其中 $ \varepsilon_i = 2^{-i} $。
- 建立对 $ \widetilde{H}^{\textsf{large}} $ 和 $ \widetilde{H}^{\textsf{small}} $ 的上界,表明其与主复杂度项的差距在 $ O(\ln \ln n) $ 因子内。
- 利用对称性与对数不等式,界定上下复杂度项之比,证明近似最优性。
实验结果
研究问题
- RQ1在随机赌博机假设下,Best-k-Arm问题的最紧实例化下界是什么?
- RQ2一种实用的基于消除的算法能否在次对数因子内实现与该下界匹配的样本复杂度?
- RQ3样本复杂度如何随前k名臂与非前k名臂之间的差距结构变化?
- RQ4臂的输入顺序在决定Best-k-Arm问题内在难度方面起什么作用?
- RQ5从Best-1-Arm到Best-k-Arm的约化能否为后者提供非平凡且紧致的下界?
主要发现
- 本文通过从Best-1-Arm问题出发的非平凡约化,为Best-k-Arm问题建立了新的实例化下界,假设奖励服从高斯分布。
- 所提出的基于消除的算法实现的样本复杂度与实例化下界在双对数因子内匹配,即 $ O(H \ln \ln n) $,其中 $ H $ 为主复杂度项。
- 该算法的样本复杂度严格优于所有先前的最先进方法(常数因子范围内)用于Best-k-Arm选择。
- 分析表明,上下复杂度项之比被 $ O(\ln \ln n) $ 有界,证明了近似最优性。
- 本文证明 $ \widetilde{H}^{\textsf{large}} + \widetilde{H}^{\textsf{small}} $ 的和被 $ O(H \ln k) $ 有界,该界在对数因子内是紧致的。
- 结果在上界假设所有奖励分布为1-次高斯分布时成立,而下界则为技术必要性假设单位方差高斯分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。