[论文解读] The True Sample Complexity of Identifying Good Arms
本文通过区分可验证与不可验证的样本复杂度,重新定义了多臂赌博机问题中的样本复杂度,提出了与实际直觉一致的新定义。该文提出了在 $\epsilon$-优质臂识别中达到 $\Theta(n/m)$ 的最优样本复杂度,以及在基于阈值的臂选择中达到 $\Theta(nk/m)$ 的算法,其中 $m$ 分别为距离最优均值 $\epsilon$ 以内或高于阈值 $\mu_0$ 的臂的数量。
We consider two multi-armed bandit problems with $n$ arms: (i) given an $ε> 0$, identify an arm with mean that is within $ε$ of the largest mean and (ii) given a threshold $μ_0$ and integer $k$, identify $k$ arms with means larger than $μ_0$. Existing lower bounds and algorithms for the PAC framework suggest that both of these problems require $Ω(n)$ samples. However, we argue that these definitions not only conflict with how these algorithms are used in practice, but also that these results disagree with intuition that says (i) requires only $Θ(\frac{n}{m})$ samples where $m = |\{ i : μ_i > \max_{i \in [n]} μ_i - ε\}|$ and (ii) requires $Θ(\frac{n}{m}k)$ samples where $m = |\{ i : μ_i > μ_0 \}|$. We provide definitions that formalize these intuitions, obtain lower bounds that match the above sample complexities, and develop explicit, practical algorithms that achieve nearly matching upper bounds.
研究动机与目标
- 解决多臂赌博机问题中理论样本复杂度界与实际性能之间的脱节问题。
- 形式化一种直觉:当仅有少量臂接近最优均值或高于阈值时,识别优质臂应需要更少样本。
- 提出反映现实世界自适应数据收集效率的不可验证样本复杂度的新定义。
- 设计在新定义下实现近似最优样本复杂度的实用算法。
- 为 $\epsilon$-优质臂识别与基于阈值的臂选择问题建立匹配的下界与上界。
提出的方法
- 提出一种新颖的不可验证样本复杂度定义,目标是在无需完全验证所有臂的情况下快速识别优质臂。
- 引入一种基于夹逼区间的算法,通过在区间内自适应采样臂,保持置信区间,并动态移除无产出的夹逼区间。
- 利用置信区间与序列假设检验,确保高概率正确性的同时最小化总样本数。
- 基于经验均值表现与未来采样需求的估计,采用启发式方法进行夹逼区间的选取与移除。
- 在基于阈值的臂选择场景中应用 Benjamini-Hochberg 过程以控制错误发现率。
- 使用带熵正则化的最大似然估计,从现实世界数据(如果蝇基因筛选)中建模底层均值分布。
实验结果
研究问题
- RQ1我们能否形式化一种直觉:当仅有少量臂接近最优均值时,识别这些臂应需要更少样本?
- RQ2当仅有 $m$ 个臂位于最大均值 $\epsilon$ 以内时,识别一个 $\epsilon$-优质臂的真实样本复杂度是多少?
- RQ3如何设计在实践中实现最优样本复杂度且保持高概率正确性的算法?
- RQ4$\epsilon$-优质臂识别与基于阈值的臂选择之间有何关系?能否使用相似的技术解决?
- RQ5在自适应数据收集中,不可验证样本复杂度与可验证样本复杂度有何不同?这对现实世界应用为何重要?
主要发现
- 本文建立了识别一个 $\epsilon$-优质臂的下界为 $\Omega(n/m)$,其中 $m$ 为位于最大均值 $\epsilon$ 以内的臂的数量。
- 提出一种算法,实现 $O(n/m)$ 的不可验证样本复杂度用于 $\epsilon$-优质臂识别,与下界相比仅差对数因子。
- 对于识别 $k$ 个高于阈值 $\mu_0$ 的臂,本文证明了下界为 $\Omega(nk/m)$,其中 $m$ 为均值高于 $\mu_0$ 的臂的数量,并提出一种实现 $O(nk/m)$ 样本复杂度的算法。
- 所提出的算法在实践中优于现有方法,尤其在优质臂稀疏的场景下表现更优,已在果蝇基因筛选的真实数据上得到验证。
- 使用不可验证样本复杂度可在有利配置下更快识别优质臂,即使完整验证需要 $\Omega(n)$ 样本。
- 夹逼区间管理的启发式方法与动态夹逼区间移除策略在不破坏理论保证的前提下,提升了经验性能并保持了高概率正确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。