[论文解读] Prediction with Corrupted Expert Advice
本文提出了一种自适应乘法权重算法,采用递减步长,在对抗性污染的随机损失下,实现了预测专家建议问题中的常数遗憾。该变体证明了其遗憾规模达到最优的 $\Theta(\log N / \Delta + C)$,且与时间范围 $T$ 无关,并在该设定下优于在线镜像下降(OMD)算法,揭示了在污染环境下 FTRL 与 OMD 框架之间存在根本性差异。
We revisit the fundamental problem of prediction with expert advice, in a setting where the environment is benign and generates losses stochastically, but the feedback observed by the learner is subject to a moderate adversarial corruption. We prove that a variant of the classical Multiplicative Weights algorithm with decreasing step sizes achieves constant regret in this setting and performs optimally in a wide range of environments, regardless of the magnitude of the injected corruption. Our results reveal a surprising disparity between the often comparable Follow the Regularized Leader (FTRL) and Online Mirror Descent (OMD) frameworks: we show that for experts in the corrupted stochastic regime, the regret performance of OMD is in fact strictly inferior to that of FTRL.
研究动机与目标
- 解决在损失以随机方式生成但受对抗性污染时,实现在线学习中最优遗憾的挑战。
- 填补在污染环境下全信息专家问题中遗憾性能理解的空白,此前的研究集中于 bandit 设置。
- 探究在污染存在时,全信息反馈是否能将对专家数量 $N$ 的依赖从线性降低到对数级。
- 证明基于 FTRL 的算法(如所提出的自适应乘法权重算法)在污染的随机设定下优于基于 OMD 的算法。
- 提供适用于任意污染水平 $C$ 的遗憾分析,且无需事先知晓 $C$。
提出的方法
- 提出经典乘法权重算法的一种变体,采用随时间递减的步长 $\eta_t = c / \sqrt{t}$,其中 $c = \sqrt{\log N}$,以适应未知的污染水平。
- 基于 FTRL 框架,采用一种新颖的分析技术,通过最佳专家的概率 $p_{t+1,i^\star}$ 的倒数来界定期望遗憾。
- 应用霍夫丁引理和集中不等式,控制专家与最佳专家之间损失差异的矩生成函数。
- 将遗憾分析分解为两个阶段:早期阶段污染可能延迟收敛,后期阶段算法集中于最佳专家。
- 建立一个阈值 $t_1$,使得当 $t \geq t_1$ 时,选择次优专家的概率呈指数衰减,从而确保遗憾有界。
- 利用 $\mathbb{E}[\log(1/x)]$ 可通过 FTRL 遗憾分解界定遗憾,最终得到以 $\log N$、$\Delta$ 和 $C$ 表示的界限。
实验结果
研究问题
- RQ1当损失以随机方式生成但受对抗性污染时,是否能在专家建议预测问题中实现常数遗憾?
- RQ2在污染存在时,全信息设定是否允许对专家数量 $N$ 实现对数依赖,而 bandit 设定则不能?
- RQ3在污染的随机设定下,基于 FTRL 的算法与基于 OMD 的算法相比性能如何?
- RQ4能否设计一种单一的自适应算法,在不事先知晓污染水平 $C$ 的前提下,实现随机、污染和完全对抗三种情形下的最优遗憾?
- RQ5在对抗性污染的随机专家问题中,最优遗憾规模是什么?能否通过一种简单、无参数的算法实现?
主要发现
- 所提出的自适应乘法权重算法实现了遗憾界 $\mathbb{E}[\overline{\mathcal{R}}_T] \leq \frac{256\log N}{\Delta}\log^2\left(\frac{8\log N}{\Delta}\right) + \frac{8\log N}{\Delta}$,其规模为 $\Theta(\log N / \Delta + C)$,且与 $T$ 无关。
- 该算法在所有三种情形下表现最优:纯随机、对抗性污染和完全对抗,且无需知晓 $C$。
- 遗憾界对 $N$ 呈对数依赖,对 $\Delta$ 呈反比依赖,证实了在污染存在时,全信息反馈可实现对 $N$ 的对数依赖。
- 基于 FTRL 的算法(如所提方法)在污染的随机设定下,其遗憾性能严格优于基于 OMD 的算法。
- 分析表明,即使存在少量对抗性污染,其对收敛的延迟也仅限于 $C$ 个污染回合,这得益于自适应步长。
- 该界限在对数因子范围内是紧的,结果表明 $\Theta(\log N / \Delta + C)$ 是该设定下的最优遗憾规模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。