[论文解读] Better Best of Both Worlds Bounds for Bandits with Switching Costs
本文提出了一种新颖的双峰 bandit 算法,在非适应性对抗设置下实现了 $\mathcal{O}(T^{2/3})$ 的极小化最大 regret,并在单位切换成本下将随机约束下的 regret 边界改进为 $\mathcal{O}(\min\{\log T / \Delta^2, T^{2/3}\})$。该方法利用改进的探索策略和对切换成本的创新分析,通过在对数因子内匹配的下界证明了其紧致性。
We study best-of-both-worlds algorithms for bandits with switching cost, recently addressed by Rouyer, Seldin and Cesa-Bianchi, 2021. We introduce a surprisingly simple and effective algorithm that simultaneously achieves minimax optimal regret bound of $\mathcal{O}(T^{2/3})$ in the oblivious adversarial setting and a bound of $\mathcal{O}(\min\{\log (T)/Δ^2,T^{2/3}\})$ in the stochastically-constrained regime, both with (unit) switching costs, where $Δ$ is the gap between the arms. In the stochastically constrained case, our bound improves over previous results due to Rouyer et al., that achieved regret of $\mathcal{O}(T^{1/3}/Δ)$. We accompany our results with a lower bound showing that, in general, $ ildeΩ(\min\{1/Δ^2,T^{2/3}\})$ regret is unavoidable in the stochastically-constrained case for algorithms with $\mathcal{O}(T^{2/3})$ worst-case regret.
研究动机与目标
- 设计一种双峰 bandit 算法,在切换成本下同时实现对抗性和随机约束设置下的最优 regret。
- 弥合随机约束设置下切换成本的最优上界与下界之间的差距。
- 建立紧致下界,表明在随机约束情况下,$\tilde{\Omega}(\min\{1/\Delta^2, T^{2/3}\})$ 的切换成本 regret 是不可避免的。
- 在随机约束设置下,改进 Rouyer 等人 [14] 的 $\mathcal{O}(T^{1/3}/\Delta)$ 边界,同时保持 $\mathcal{O}(T^{2/3})$ 的最坏情况 regret。
- 探索一般 $K>2$ 情况下更紧致边界的可能,并识别随机与随机约束设置下的开放问题。
提出的方法
- 提出一种新算法,结合改进的探索策略与对切换成本的细致分析,以平衡 regret 和动作变化。
- 采用 Tsallis-INF 框架的变体,并引入一种新型正则化项,以控制切换频率,同时保持 regret 保证。
- 使用双重分析框架,分别在对抗性和随机约束设置下界定 regret,后者利用了间隙 $\Delta$。
- 应用剥皮论证和集中不等式,控制切换到次优动作的次数,在随机约束情况下实现 $\mathcal{O}(\log T / \Delta^2)$ 次切换。
- 通过精心构造的随机环境推导下界,证明在切换成本下 $\tilde{\Omega}(\min\{1/\Delta^2, T^{2/3}\})$ 的 regret 是不可避免的。
- 通过引入参数 $\lambda$ 来建模每次切换的成本,分析 regret 与切换成本之间的权衡,并推导出以 $\lambda$ 表示的边界。
实验结果
研究问题
- RQ1双峰 bandit 算法能否在单位切换成本下,同时实现对抗设置下的 $\mathcal{O}(T^{2/3})$ regret 和随机约束设置下的 $\mathcal{O}(\log T / \Delta^2)$ regret?
- RQ2Rouyer 等人 [14] 的 $\mathcal{O}(T^{1/3}/\Delta)$ 边界是否紧致,还是能在随机约束情况下改进为 $\mathcal{O}(\log T / \Delta^2)$?
- RQ3在具有 $\mathcal{O}(T^{2/3})$ 最坏情况 regret 和切换成本的算法中,随机约束设置下的最优极小化最大 regret 率是多少?
- RQ4该下界能否推广到 $K>2$ 的情况,还是仅适用于 $K=2$?
- RQ5在切换成本下,随机设置与随机约束设置之间是否存在可实现 regret 的分离?
主要发现
- 所提出的算法在非适应性对抗设置下实现了 $\mathcal{O}(T^{2/3})$ 的 regret,与已知的极小化最大下界在对数因子内匹配。
- 在随机约束设置下,算法实现了 $\mathcal{O}(\min\{\log T / \Delta^2, T^{2/3}\})$ 的 regret,优于 Rouyer 等人 [14] 的先前 $\mathcal{O}(T^{1/3}/\Delta)$ 边界。
- 建立了 $\tilde{\Omega}(\min\{1/\Delta^2, T^{2/3}\})$ 的下界,表明新上界在对数因子内是紧致的。
- 在随机约束设置下的改进源于对切换频率的精细化分析,表明切换到次优动作的次数为 $\tilde{\mathcal{O}}(1/\Delta^2)$。
- 对于 $K>2$,上下界尚未完全匹配,最优率仍为开放问题。
- 本文指出随机与随机约束设置之间可能存在分离,暗示在纯随机情况下,双峰算法可能不可行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。