Skip to main content
QUICK REVIEW

[论文解读] Better Best of Both Worlds Bounds for Bandits with Switching Costs

Idan Amir, Guy Azov|arXiv (Cornell University)|Jun 7, 2022
Advanced Bandit Algorithms Research被引用 5
一句话总结

本文提出了一种新颖的双峰 bandit 算法,在非适应性对抗设置下实现了 $\mathcal{O}(T^{2/3})$ 的极小化最大 regret,并在单位切换成本下将随机约束下的 regret 边界改进为 $\mathcal{O}(\min\{\log T / \Delta^2, T^{2/3}\})$。该方法利用改进的探索策略和对切换成本的创新分析,通过在对数因子内匹配的下界证明了其紧致性。

ABSTRACT

We study best-of-both-worlds algorithms for bandits with switching cost, recently addressed by Rouyer, Seldin and Cesa-Bianchi, 2021. We introduce a surprisingly simple and effective algorithm that simultaneously achieves minimax optimal regret bound of $\mathcal{O}(T^{2/3})$ in the oblivious adversarial setting and a bound of $\mathcal{O}(\min\{\log (T)/Δ^2,T^{2/3}\})$ in the stochastically-constrained regime, both with (unit) switching costs, where $Δ$ is the gap between the arms. In the stochastically constrained case, our bound improves over previous results due to Rouyer et al., that achieved regret of $\mathcal{O}(T^{1/3}/Δ)$. We accompany our results with a lower bound showing that, in general, $ ildeΩ(\min\{1/Δ^2,T^{2/3}\})$ regret is unavoidable in the stochastically-constrained case for algorithms with $\mathcal{O}(T^{2/3})$ worst-case regret.

研究动机与目标

  • 设计一种双峰 bandit 算法,在切换成本下同时实现对抗性和随机约束设置下的最优 regret。
  • 弥合随机约束设置下切换成本的最优上界与下界之间的差距。
  • 建立紧致下界,表明在随机约束情况下,$\tilde{\Omega}(\min\{1/\Delta^2, T^{2/3}\})$ 的切换成本 regret 是不可避免的。
  • 在随机约束设置下,改进 Rouyer 等人 [14] 的 $\mathcal{O}(T^{1/3}/\Delta)$ 边界,同时保持 $\mathcal{O}(T^{2/3})$ 的最坏情况 regret。
  • 探索一般 $K>2$ 情况下更紧致边界的可能,并识别随机与随机约束设置下的开放问题。

提出的方法

  • 提出一种新算法,结合改进的探索策略与对切换成本的细致分析,以平衡 regret 和动作变化。
  • 采用 Tsallis-INF 框架的变体,并引入一种新型正则化项,以控制切换频率,同时保持 regret 保证。
  • 使用双重分析框架,分别在对抗性和随机约束设置下界定 regret,后者利用了间隙 $\Delta$。
  • 应用剥皮论证和集中不等式,控制切换到次优动作的次数,在随机约束情况下实现 $\mathcal{O}(\log T / \Delta^2)$ 次切换。
  • 通过精心构造的随机环境推导下界,证明在切换成本下 $\tilde{\Omega}(\min\{1/\Delta^2, T^{2/3}\})$ 的 regret 是不可避免的。
  • 通过引入参数 $\lambda$ 来建模每次切换的成本,分析 regret 与切换成本之间的权衡,并推导出以 $\lambda$ 表示的边界。

实验结果

研究问题

  • RQ1双峰 bandit 算法能否在单位切换成本下,同时实现对抗设置下的 $\mathcal{O}(T^{2/3})$ regret 和随机约束设置下的 $\mathcal{O}(\log T / \Delta^2)$ regret?
  • RQ2Rouyer 等人 [14] 的 $\mathcal{O}(T^{1/3}/\Delta)$ 边界是否紧致,还是能在随机约束情况下改进为 $\mathcal{O}(\log T / \Delta^2)$?
  • RQ3在具有 $\mathcal{O}(T^{2/3})$ 最坏情况 regret 和切换成本的算法中,随机约束设置下的最优极小化最大 regret 率是多少?
  • RQ4该下界能否推广到 $K>2$ 的情况,还是仅适用于 $K=2$?
  • RQ5在切换成本下,随机设置与随机约束设置之间是否存在可实现 regret 的分离?

主要发现

  • 所提出的算法在非适应性对抗设置下实现了 $\mathcal{O}(T^{2/3})$ 的 regret,与已知的极小化最大下界在对数因子内匹配。
  • 在随机约束设置下,算法实现了 $\mathcal{O}(\min\{\log T / \Delta^2, T^{2/3}\})$ 的 regret,优于 Rouyer 等人 [14] 的先前 $\mathcal{O}(T^{1/3}/\Delta)$ 边界。
  • 建立了 $\tilde{\Omega}(\min\{1/\Delta^2, T^{2/3}\})$ 的下界,表明新上界在对数因子内是紧致的。
  • 在随机约束设置下的改进源于对切换频率的精细化分析,表明切换到次优动作的次数为 $\tilde{\mathcal{O}}(1/\Delta^2)$。
  • 对于 $K>2$,上下界尚未完全匹配,最优率仍为开放问题。
  • 本文指出随机与随机约束设置之间可能存在分离,暗示在纯随机情况下,双峰算法可能不可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。