QUICK REVIEW
[论文解读] Better Algorithms for Stochastic Bandits with Adversarial Corruptions
Anupam Gupta, Tomer Koren|arXiv (Cornell University)|Feb 22, 2019
Advanced Bandit Algorithms Research参考文献 26被引用 13
一句话总结
本文提出 BARBAR,一种针对对抗性污染下随机多臂赌博机的新算法,其遗憾为污染水平 $C$ 的加法形式而非乘法形式,从而在高污染情况下仍能保持鲁棒性能。该算法对 $C$ 无感知,可自动适应,并在附加 $O(KC)$ 项内达到最优无污染遗憾。
ABSTRACT
We study the stochastic multi-armed bandits problem in the presence of adversarial corruption. We present a new algorithm for this problem whose regret is nearly optimal, substantially improving upon previous work. Our algorithm is agnostic to the level of adversarial contamination and can tolerate a significant amount of corruption with virtually no degradation in performance.
研究动机与目标
- 解决在奖励受对手污染时,维持随机赌博机中强遗憾保证的挑战。
- 克服先前算法在遗憾上遭受与 $C$(总污染水平)成比例的乘法退化的问题。
- 设计一种对污染水平 $C$ 无感知的方法,无需事先知晓 $C$ 的信息。
- 实现从最优随机情形到对抗性情形的遗憾界平滑退化。
- 提供一种简单实用的算法,在低污染和高污染情况下均能保持高性能。
提出的方法
- 提出 BARBAR,一种新算法,结合多个 UCB 风格的探索阶段与自适应过滤机制,以检测并缓解污染反馈。
- 采用分层结构,每一层使用逐步增大的置信区间应用 UCB,通过冗余实现鲁棒性。
- 提出一种基于跨层奖励一致性检查的新型污染检测机制,使算法能够识别并丢弃污染反馈。
- 分别维护臂的均值和置信区间估计,仅在反馈一致时才更新,以避免污染引起的偏差。
- 基于观测奖励的一致性,动态选择最可靠的层级,确保最终选择对对抗性污染具有鲁棒性。
- 通过确保算法决策基于多数一致观测(即使最多 $C$ 轮被污染)来实现鲁棒性。
实验结果
研究问题
- RQ1我们能否设计一种随机赌博机算法,在不事先知晓污染水平 $C$ 的情况下,仍能维持接近最优的遗憾?
- RQ2是否可能实现遗憾在 $C$ 上呈加法依赖而非乘法依赖,从而在高污染下仍能保持性能?
- RQ3能否构建一种简单、无感知的算法,自动适应污染水平,而无需调参或先验假设?
- RQ4在对抗性污染下,随机赌博机中鲁棒性与遗憾之间的根本权衡是什么?
- RQ5是否能改进遗憾界,消除 $\text{polylog}(T)$ 的依赖,同时保持鲁棒性?
主要发现
- 所提出的 BARBAR 算法以高概率实现遗憾界 $O(KC) + \widetilde{O}\left(\sum_{i \neq i^*} \frac{1}{\Delta_i}\right)$,其在 $C$ 上为加法形式。
- 该界优于先前最先进结果 $\widetilde{O}(KC \sum_{i \neq i^*} \frac{1}{\Delta_i})$,通过去除乘法因子 $C$ 实现改进。
- 该算法对 $C$ 无感知,无需事先知晓污染水平,即使 $C$ 较大时仍表现良好。
- 对于 $\Delta_i = \sqrt{K/T}$ 的困难情形,当 $C = O(\sqrt{T/K})$ 时,BARBAR 实现 $\widetilde{O}(\sqrt{KT})$ 的遗憾,与无污染情形一致。
- 该算法优于先前工作,后者在 $C = O(1)$ 时即显著退化,且当 $C = \Omega(\sqrt{T/K})$ 时变得无意义。
- 建立了 $\Omega(C)$ 的遗憾下界,表明上界中加法依赖 $C$ 几乎是紧的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。