Skip to main content
QUICK REVIEW

[论文解读] Stochastic Linear Bandits Robust to Adversarial Attacks

Ilija Bogunovic, Arpan Losalka|arXiv (Cornell University)|Jul 7, 2020
Advanced Bandit Algorithms Research参考文献 26被引用 7
一句话总结

该论文提出了两种针对对抗性污染下随机线性Bandit的鲁棒分阶段消除算法,其中一种变体需要已知污染预算 $C$,另一种则不需要。在无污染情况下,两种算法均实现近似最优遗憾;在污染存在时,分别产生与 $C$ 呈线性和二次依赖关系的加法遗憾项,且通过算法无关的下界分析表明这些依赖关系也是近似最优的。

ABSTRACT

We consider a stochastic linear bandit problem in which the rewards are not only subject to random noise, but also adversarial attacks subject to a suitable budget $C$ (i.e., an upper bound on the sum of corruption magnitudes across the time horizon). We provide two variants of a Robust Phased Elimination algorithm, one that knows $C$ and one that does not. Both variants are shown to attain near-optimal regret in the non-corrupted case $C = 0$, while incurring additional additive terms respectively having a linear and quadratic dependency on $C$ in general. We present algorithm independent lower bounds showing that these additive terms are near-optimal. In addition, in a contextual setting, we revisit a setup of diverse contexts, and show that a simple greedy algorithm is provably robust with a near-optimal additive regret term, despite performing no explicit exploration and not knowing $C$.

研究动机与目标

  • 为填补在对抗性污染设置下随机线性Bandit理解上的空白,特别是针对此前缺乏鲁棒性保证的场景。
  • 设计在非污染情形($C=0$)下保持近似最优遗憾,同时在对抗性攻击下实现平稳退化的算法。
  • 建立显式依赖于污染预算 $C$ 的紧致遗憾界,区分已知与未知 $C$ 的情形。
  • 重新审视具有上下文多样性的上下文线性Bandit设置,证明即使无显式探索或 $C$ 知识,简单贪婪算法也能实现可证明的鲁棒性。

提出的方法

  • 提出一种鲁棒分阶段消除算法,通过扩大置信区间以应对潜在的对抗性污染。
  • 引入两种变体:一种已知 $C$ 并利用其校准置信区间,另一种则无需先验知识,自适应地估计 $C$。
  • 采用分阶段消除策略,基于经污染调整的置信区间系统性地剔除次优臂。
  • 推导在对抗性污染下估计参数向量的高概率集中界,确保对最坏情况攻击的鲁棒性。
  • 提出一种新颖的分析框架,将遗憾分解为随机与对抗性两部分,从而隔离出由污染引起的加法项。
  • 重新审视具有上下文多样性的上下文线性Bandit设置,并证明贪婪算法即使无显式探索或 $C$ 依赖,也能实现近似最优遗憾。

实验结果

研究问题

  • RQ1我们能否设计一种随机线性Bandit算法,在奖励受具有有界总污染预算 $C$ 的对手污染时,仍保持近似最优遗憾?
  • RQ2当 $C$ 已知或未知时,遗憾对污染预算 $C$ 的最优依赖形式是加法还是乘法?
  • RQ3在上下文多样性条件下,是否可能在无显式探索或 $C$ 知识的情况下实现上下文线性Bandit的鲁棒性?
  • RQ4在对抗性污染下,所提算法与现有算法相比,其遗憾界表现如何?
  • RQ5能否推导出算法无关的下界,以证明所提 $C$ 的加法遗憾项的近似最优性?

主要发现

  • 已知 $C$ 的算法实现与 $C$ 线性依赖的遗憾,该结果被算法无关的下界证明为近似最优。
  • 未知 $C$ 的算法产生与 $C$ 二次依赖的遗憾,该依赖关系同样被证明为近似最优。
  • 在无污染情形($C=0$)下,两种算法均实现近似最优遗憾量级,与标准随机线性Bandit的最佳已知界一致。
  • 在具有上下文多样性的上下文线性Bandit设置中,即使无显式探索或 $C$ 知识,简单贪婪算法仍能实现近似最优遗憾,且加法项依赖于 $C$。
  • 论文证明,$C$ 的加法遗憾项在对数因子意义下为最优,解决了关于加法与乘法依赖关系的开放问题。
  • 结果表明,即使无显式探索机制,线性Bandit中对抗性污染的鲁棒性也可通过极小的算法开销实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。