[论文解读] Selecting the best system and multi-armed bandits
本文证明,对于具有无界支撑的轻尾分布,任何算法都无法以至少 $1 - \delta$ 的概率保证正确选择最优系统,且在期望样本数为 $O(\log(1/\delta))$ 的情况下,所需期望样本量会变为无穷大。作者证明,若无矩约束,此类保证本质上具有误导性;然而,他们也表明,当高阶矩有界时,$O(\log(1/\delta))$ 的算法是可行的。
Consider the problem of finding a population or a probability distribution amongst many with the largest mean when these means are unknown but population samples can be simulated or otherwise generated. Typically, by selecting largest sample mean population, it can be shown that false selection probability decays at an exponential rate. Lately, researchers have sought algorithms that guarantee that this probability is restricted to a small $δ$ in order $\log(1/δ)$ computational time by estimating the associated large deviations rate function via simulation. We show that such guarantees are misleading when populations have unbounded support even when these may be light-tailed. Specifically, we show that any policy that identifies the correct population with probability at least $1-δ$ for each problem instance requires infinite number of samples in expectation in making such a determination in any problem instance. This suggests that some restrictions are essential on populations to devise $O(\log(1/δ))$ algorithms with $1 - δ$ correctness guarantees. We note that under restriction on population moments, such methods are easily designed, and that sequential methods from stochastic multi-armed bandit literature can be adapted to devise such algorithms.
研究动机与目标
- 研究 $O(\log(1/\delta))$ 算法是否能保证在 $d$ 个未知均值的总体中以 $1 - \delta$ 的概率正确选择最优系统。
- 分析在具有无界右支撑的轻尾分布下,错误选择概率的指数衰减是否成立。
- 确定在何种条件下,具有高置信度保证的 $O(\log(1/\delta))$ 算法是可行的。
- 阐明基于大偏差理论的方法在纯探索设置中的局限性。
- 确立矩约束对于此类算法中有限期望样本复杂度的必要性。
提出的方法
- 使用大偏差理论分析在从 $d$ 个总体独立同分布抽样下,错误选择概率的指数衰减率。
- 通过构造一族具有无界支撑的轻尾分布的反例,表明任何保证 $1 - \delta$ 正确性的策略,其期望样本复杂度均为无穷大。
- 应用变分法在矩约束下优化大偏差率函数。
- 利用适用于次威布尔随机变量的伯恩斯坦型不等式,推导截断估计量的偏差界。
- 在矩约束下,改编随机多臂老虎机文献中的顺序抽样策略。
- 使用微积分与优化方法,证明在所推导约束下,最优抽样策略的质量集中在极端点。
实验结果
研究问题
- RQ1当总体具有无界支撑时,是否存在任何算法能够以 $O(\log(1/\delta))$ 的样本数实现 $1 - \delta$ 的正确性?
- RQ2在支撑无界的情况下,错误选择概率的指数衰减是否足以保证有限的期望样本复杂度?
- RQ3矩条件在实现具有高置信度保证的 $O(\log(1/\delta))$ 算法中起什么作用?
- RQ4基于大偏差的方法是否适用于所有轻尾分布,还是存在隐藏假设?
- RQ5能否在矩约束下,将多臂老虎机中的顺序抽样策略改编以实现 $O(\log(1/\delta))$ 的样本复杂度?
主要发现
- 对于具有无界支撑的轻尾分布,任何保证 $1 - \delta$ 正确性的策略,在最优臂选择中所需的期望样本数均为无穷大。
- 当支撑无界时,错误选择概率的指数衰减并不能保证有限的期望样本复杂度。
- 在矩有界条件下,可以构造出具有 $1 - \delta$ 正确性保证的 $O(\log(1/\delta))$ 算法。
- 在矩约束下,最优抽样策略的质量集中在极端点,最优阈值由次威布尔尾参数决定。
- 次威布尔变量的伯恩斯坦不等式使得截断估计量的偏差得以控制,从而支持有限样本分析。
- 通过变分优化,推导出在矩约束下最小化错误选择概率的最优分配策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。