Skip to main content
QUICK REVIEW

[论文解读] Better Algorithms for Stochastic Bandits with Adversarial Corruptions

Anupam Gupta, Tomer Koren|arXiv (Cornell University)|Feb 22, 2019
Advanced Bandit Algorithms Research参考文献 26被引用 13
一句话总结

本文提出 BARBAR,一种针对对抗性污染下随机多臂赌博机的新算法,其遗憾为污染水平 $C$ 的加法形式而非乘法形式,从而在高污染情况下仍能保持鲁棒性能。该算法对 $C$ 无感知,可自动适应,并在附加 $O(KC)$ 项内达到最优无污染遗憾。

ABSTRACT

We study the stochastic multi-armed bandits problem in the presence of adversarial corruption. We present a new algorithm for this problem whose regret is nearly optimal, substantially improving upon previous work. Our algorithm is agnostic to the level of adversarial contamination and can tolerate a significant amount of corruption with virtually no degradation in performance.

研究动机与目标

  • 解决在奖励受对手污染时,维持随机赌博机中强遗憾保证的挑战。
  • 克服先前算法在遗憾上遭受与 $C$(总污染水平)成比例的乘法退化的问题。
  • 设计一种对污染水平 $C$ 无感知的方法,无需事先知晓 $C$ 的信息。
  • 实现从最优随机情形到对抗性情形的遗憾界平滑退化。
  • 提供一种简单实用的算法,在低污染和高污染情况下均能保持高性能。

提出的方法

  • 提出 BARBAR,一种新算法,结合多个 UCB 风格的探索阶段与自适应过滤机制,以检测并缓解污染反馈。
  • 采用分层结构,每一层使用逐步增大的置信区间应用 UCB,通过冗余实现鲁棒性。
  • 提出一种基于跨层奖励一致性检查的新型污染检测机制,使算法能够识别并丢弃污染反馈。
  • 分别维护臂的均值和置信区间估计,仅在反馈一致时才更新,以避免污染引起的偏差。
  • 基于观测奖励的一致性,动态选择最可靠的层级,确保最终选择对对抗性污染具有鲁棒性。
  • 通过确保算法决策基于多数一致观测(即使最多 $C$ 轮被污染)来实现鲁棒性。

实验结果

研究问题

  • RQ1我们能否设计一种随机赌博机算法,在不事先知晓污染水平 $C$ 的情况下,仍能维持接近最优的遗憾?
  • RQ2是否可能实现遗憾在 $C$ 上呈加法依赖而非乘法依赖,从而在高污染下仍能保持性能?
  • RQ3能否构建一种简单、无感知的算法,自动适应污染水平,而无需调参或先验假设?
  • RQ4在对抗性污染下,随机赌博机中鲁棒性与遗憾之间的根本权衡是什么?
  • RQ5是否能改进遗憾界,消除 $\text{polylog}(T)$ 的依赖,同时保持鲁棒性?

主要发现

  • 所提出的 BARBAR 算法以高概率实现遗憾界 $O(KC) + \widetilde{O}\left(\sum_{i \neq i^*} \frac{1}{\Delta_i}\right)$,其在 $C$ 上为加法形式。
  • 该界优于先前最先进结果 $\widetilde{O}(KC \sum_{i \neq i^*} \frac{1}{\Delta_i})$,通过去除乘法因子 $C$ 实现改进。
  • 该算法对 $C$ 无感知,无需事先知晓污染水平,即使 $C$ 较大时仍表现良好。
  • 对于 $\Delta_i = \sqrt{K/T}$ 的困难情形,当 $C = O(\sqrt{T/K})$ 时,BARBAR 实现 $\widetilde{O}(\sqrt{KT})$ 的遗憾,与无污染情形一致。
  • 该算法优于先前工作,后者在 $C = O(1)$ 时即显著退化,且当 $C = \Omega(\sqrt{T/K})$ 时变得无意义。
  • 建立了 $\Omega(C)$ 的遗憾下界,表明上界中加法依赖 $C$ 几乎是紧的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。