[论文解读] An algorithm with nearly optimal pseudo-regret for both stochastic and adversarial bandits
本文提出了 SAPO 算法,在随机和对抗性多臂赌博机设置中均实现了近乎最优的伪遗憾。该算法结合了自适应探索与置信区间跟踪,并在必要时切换至 Exp3.P,实现了 $O(\log n)$ 的随机伪遗憾和 $O(\sqrt{n \log n})$ 的对抗性伪遗憾,解决了关于这两种情形之间权衡的一个开放问题。
We present an algorithm that achieves almost optimal pseudo-regret bounds against adversarial and stochastic bandits. Against adversarial bandits the pseudo-regret is $O(K\sqrt{n \log n})$ and against stochastic bandits the pseudo-regret is $O(\sum_i (\log n)/Δ_i)$. We also show that no algorithm with $O(\log n)$ pseudo-regret against stochastic bandits can achieve $ ilde{O}(\sqrt{n})$ expected regret against adaptive adversarial bandits. This complements previous results of Bubeck and Slivkins (2012) that show $ ilde{O}(\sqrt{n})$ expected adversarial regret with $O((\log n)^2)$ stochastic pseudo-regret.
研究动机与目标
- 通过设计一个在两种情形下均表现良好的单一算法,弥合已知的随机与对抗性赌博机界限之间的差距。
- 确定 $O(\log n)$ 的随机伪遗憾是否与 $\tilde{O}(\sqrt{n})$ 的对抗性遗憾兼容。
- 刻画在随机与对抗性环境中性能之间的根本权衡。
- 建立在随机与对抗性遗憾之间必要权衡的紧致下界。
提出的方法
- SAPO 算法采用两阶段策略:先进行基于置信区间的主动探索,随后在必要时切换至 Exp3.P。
- 它维护下置信区间 $\mathrm{lcb}^*(t)$ 以追踪潜在遗憾,并利用测试阶段评估臂的质量。
- 通过基于差距的阈值 $C_{\mathrm{gap}} \cdot \tilde{\Delta}_i$ 识别并从活跃游戏中移除劣质臂,确保遗憾可控。
- 算法通过加倍与减半动态调整阶段长度,其上限由 $M = \lceil \log_2 n \rceil + 2E^0$ 限定。
- 使用集中不等式(包括 Bernstein 和 Hoeffding-Azuma 变体)来限制预期遗憾和动作计数的方差。
- 切换机制在时间 $n_S$ 触发,确保对自适应对手的鲁棒性。
实验结果
研究问题
- RQ1是否存在一种算法,能够在实现 $O(\log n)$ 随机伪遗憾的同时,保持 $\tilde{O}(\sqrt{n})$ 的对抗性伪遗憾?
- RQ2对于 $\tilde{O}(\sqrt{n})$ 的对抗性遗憾,是否必须具备 $O((\log n)^2)$ 的随机伪遗憾?
- RQ3在随机与对抗性赌博机设置中同时实现低遗憾的根本限制是什么?
- RQ4能否设计一种单一算法,自适应地在两种赌博机类型之间平衡探索与利用?
主要发现
- SAPO 算法实现了 $O(\log n)$ 的随机伪遗憾和 $O(\sqrt{n \log n})$ 的对抗性伪遗憾,分别达到了各自情形下已知的最佳界限。
- 对于任意 $\beta < 2$,若随机伪遗憾为 $O((\log n)^\beta)$,则在对抗性对手下,以概率 $\Omega(n^{-\epsilon})$ 产生 $\Omega(n^\alpha)$ 的遗憾,其中 $\alpha < 1$。
- 任何具有 $O(\log n)$ 随机伪遗憾的算法,都无法在自适应对手下实现 $\tilde{O}(\sqrt{n})$ 的期望遗憾。
- 分析表明,$O((\log n)^2)$ 的随机伪遗憾对于实现 $\tilde{O}(\sqrt{n})$ 的对抗性遗憾是必要的,从而确认了这一紧致权衡。
- 该算法确保任意劣质臂的动作次数以高概率被限制在 $O(M / \tilde{\Delta}_i^2)$ 以内,其中 $M = \lceil \log_2 n \rceil + 2E^0$。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。