Skip to main content
QUICK REVIEW

[论文解读] An algorithm with nearly optimal pseudo-regret for both stochastic and adversarial bandits

Peter Auer, Chao-Kai Chiang|arXiv (Cornell University)|May 27, 2016
Advanced Bandit Algorithms Research参考文献 5被引用 22
一句话总结

本文提出了 SAPO 算法,在随机和对抗性多臂赌博机设置中均实现了近乎最优的伪遗憾。该算法结合了自适应探索与置信区间跟踪,并在必要时切换至 Exp3.P,实现了 $O(\log n)$ 的随机伪遗憾和 $O(\sqrt{n \log n})$ 的对抗性伪遗憾,解决了关于这两种情形之间权衡的一个开放问题。

ABSTRACT

We present an algorithm that achieves almost optimal pseudo-regret bounds against adversarial and stochastic bandits. Against adversarial bandits the pseudo-regret is $O(K\sqrt{n \log n})$ and against stochastic bandits the pseudo-regret is $O(\sum_i (\log n)/Δ_i)$. We also show that no algorithm with $O(\log n)$ pseudo-regret against stochastic bandits can achieve $ ilde{O}(\sqrt{n})$ expected regret against adaptive adversarial bandits. This complements previous results of Bubeck and Slivkins (2012) that show $ ilde{O}(\sqrt{n})$ expected adversarial regret with $O((\log n)^2)$ stochastic pseudo-regret.

研究动机与目标

  • 通过设计一个在两种情形下均表现良好的单一算法,弥合已知的随机与对抗性赌博机界限之间的差距。
  • 确定 $O(\log n)$ 的随机伪遗憾是否与 $\tilde{O}(\sqrt{n})$ 的对抗性遗憾兼容。
  • 刻画在随机与对抗性环境中性能之间的根本权衡。
  • 建立在随机与对抗性遗憾之间必要权衡的紧致下界。

提出的方法

  • SAPO 算法采用两阶段策略:先进行基于置信区间的主动探索,随后在必要时切换至 Exp3.P。
  • 它维护下置信区间 $\mathrm{lcb}^*(t)$ 以追踪潜在遗憾,并利用测试阶段评估臂的质量。
  • 通过基于差距的阈值 $C_{\mathrm{gap}} \cdot \tilde{\Delta}_i$ 识别并从活跃游戏中移除劣质臂,确保遗憾可控。
  • 算法通过加倍与减半动态调整阶段长度,其上限由 $M = \lceil \log_2 n \rceil + 2E^0$ 限定。
  • 使用集中不等式(包括 Bernstein 和 Hoeffding-Azuma 变体)来限制预期遗憾和动作计数的方差。
  • 切换机制在时间 $n_S$ 触发,确保对自适应对手的鲁棒性。

实验结果

研究问题

  • RQ1是否存在一种算法,能够在实现 $O(\log n)$ 随机伪遗憾的同时,保持 $\tilde{O}(\sqrt{n})$ 的对抗性伪遗憾?
  • RQ2对于 $\tilde{O}(\sqrt{n})$ 的对抗性遗憾,是否必须具备 $O((\log n)^2)$ 的随机伪遗憾?
  • RQ3在随机与对抗性赌博机设置中同时实现低遗憾的根本限制是什么?
  • RQ4能否设计一种单一算法,自适应地在两种赌博机类型之间平衡探索与利用?

主要发现

  • SAPO 算法实现了 $O(\log n)$ 的随机伪遗憾和 $O(\sqrt{n \log n})$ 的对抗性伪遗憾,分别达到了各自情形下已知的最佳界限。
  • 对于任意 $\beta < 2$,若随机伪遗憾为 $O((\log n)^\beta)$,则在对抗性对手下,以概率 $\Omega(n^{-\epsilon})$ 产生 $\Omega(n^\alpha)$ 的遗憾,其中 $\alpha < 1$。
  • 任何具有 $O(\log n)$ 随机伪遗憾的算法,都无法在自适应对手下实现 $\tilde{O}(\sqrt{n})$ 的期望遗憾。
  • 分析表明,$O((\log n)^2)$ 的随机伪遗憾对于实现 $\tilde{O}(\sqrt{n})$ 的对抗性遗憾是必要的,从而确认了这一紧致权衡。
  • 该算法确保任意劣质臂的动作次数以高概率被限制在 $O(M / \tilde{\Delta}_i^2)$ 以内,其中 $M = \lceil \log_2 n \rceil + 2E^0$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。