Skip to main content
QUICK REVIEW

[论文解读] Bridging Adversarial and Nonstationary Multi-armed Bandit

Ningyuan Chen, Shuoguang Yang|arXiv (Cornell University)|Jan 5, 2022
Advanced Bandit Algorithms Research被引用 4
一句话总结

本文提出了一种统一的多臂赌博机框架,通过切换预算 $S_T$ 将对抗性与非平稳赌博机相连接,该预算控制最优动作序列可更改的次数。所提出的 AE3 算法在 $S_T$ 和变分预算 $V_T$ 的调节下,实现了在对抗性($ ilde{O}( extstyle rac{1}{2} ext{KS}_T T}$)与非平稳性($ ilde{O}((KV_T)^{1/3}T^{2/3})$)模式之间平滑过渡的近似最优遗憾,相变点位于 $S_T acksimeq K^{-1/3}V_T^{2/3}T^{1/3}$。

ABSTRACT

In the multi-armed bandit framework, there are two formulations that are commonly employed to handle time-varying reward distributions: adversarial bandit and nonstationary bandit. Although their oracles, algorithms, and regret analysis differ significantly, we provide a unified formulation in this paper that smoothly bridges the two as special cases. The formulation uses an oracle that takes the best-fixed arm within time windows. Depending on the window size, it turns into the oracle in hindsight in the adversarial bandit and dynamic oracle in the nonstationary bandit. We provide algorithms that attain the optimal regret with the matching lower bound.

研究动机与目标

  • 弥合对抗性与非平稳性赌博机框架之间的差距,二者在预言机、算法与遗憾界方面存在差异。
  • 通过切换预算 $S_T$ 控制允许的动作切换次数,将这两种设定统一于单一公式下。
  • 设计一种可动态适应 $S_T$ 与 $V_T$ 的算法,以在对抗性与非平稳性环境中实现自适应。
  • 建立紧密的遗憾界,反映在 $S_T \asymp K^{-1/3}V_T^{2/3}T^{1/3}$ 处的相变现象,捕捉保守性与适应性之间的权衡。
  • 通过理论与实证验证,证明该算法在不同非平稳性水平与切换约束下的最优性与鲁棒性。

提出的方法

  • 统一的预言机定义为:在最多 $S_T$ 次切换的动作序列中,累积奖励的最大值,其在 $S_T = 1$ 时插值为静态预言机,在 $S_T \geq T$ 时插值为动态预言机。
  • 设计一种自适应探索策略,以平衡对当前估计的利用与对潜在切换点的探索,采用时间相关的置信区间。
  • AE3 算法在 $S_T$ 较小时将时间范围划分为大小为 $\Delta = \lceil T / S_T \rceil$ 的块,并在每个块内应用改进的 EXP3 风格更新。
  • 在两种模式下进行遗憾分析:当 $S_T \geq K^{-1/3}V_T^{2/3}T^{1/3}$ 时,遗憾界为 $\tilde{O}((KV_T)^{1/3}T^{2/3})$;当 $S_T \leq K^{-1/3}V_T^{2/3}T^{1/3}$ 时,遗憾界为 $\tilde{O}(\sqrt{KS_T T})$。
  • 推导下界以证明遗憾界在对数因子内是紧的,从而确认 AE3 算法的最优性。
  • 通过在不同 $T$、$K$、$S_T$ 与 $V_T$ 下的模拟进行实证验证,对数-对数图确认了理论斜率:$T$ 的斜率为 $2/3$,$V_T$ 的斜率为 $1/3$,$K$ 的斜率为 $1/3$ 或 $1/2$,具体取决于所处模式。

实验结果

研究问题

  • RQ1如何通过一个连续参数,正式统一对抗性与非平稳性赌博机问题?
  • RQ2在非平稳环境中,当代理的期望受切换预算 $S_T$ 约束时,可实现的最优遗憾是多少?
  • RQ3遗憾是否在临界切换预算 $S_T \asymp K^{-1/3}V_T^{2/3}T^{1/3}$ 处表现出相变?若存在,其在界限中如何体现?
  • RQ4是否存在一种算法,可在不事先知晓 $S_T$ 的情况下,实现对抗性与非平稳性模式下的近似最优遗憾?
  • RQ5所提出的 AE3 算法在两种模式下是否均达到最优?实证结果是否与理论预测一致?

主要发现

  • 当切换预算 $S_T$ 较大时($S_T \geq K^{-1/3}V_T^{2/3}T^{1/3}$),遗憾界为 $\tilde{O}((KV_T)^{1/3}T^{2/3})$,与非平稳赌博机的下界一致。
  • 当切换预算 $S_T$ 较小时($S_T \leq K^{-1/3}V_T^{2/3}T^{1/3}$),遗憾界为 $\tilde{O}(\sqrt{KS_T T})$,与对抗性赌博机的下界一致。
  • 遗憾在 $S_T \asymp K^{-1/3}V_T^{2/3}T^{1/3}$ 处表现出相变,主导标度从对 $S_T$ 的依赖转变为对 $V_T$ 的依赖。
  • 实证结果确认了理论斜率:$ \log$-遗憾与 $ \log T$ 的斜率为 $2/3$,与 $ \log V_T$ 的斜率为 $1/3$,与 $ \log K$ 的斜率为 $1/3$ 或 $1/2$,具体取决于所处模式。
  • 在大 $S_T$ 模式下,臂的数量 $K$ 对遗憾的影响为 $K^{1/3}$;在小 $S_T$ 模式下,影响为 $K^{1/2}$,与理论边界一致。
  • AE3 在两种模式下均实现了近似最优,其在多种模拟设置下的实证性能与理论预测高度吻合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。