Skip to main content
QUICK REVIEW

[论文解读] On Abruptly-Changing and Slowly-Varying Multiarmed Bandit Problems

Lai Wei, Vaibhav Srivastava|arXiv (Cornell University)|Feb 23, 2018
Advanced Bandit Algorithms Research被引用 6
一句话总结

本文提出了两种新颖的算法——有限记忆确定性探索与利用排序(LM-DSEE)和滑动窗口置信上界#(SW-UCB#)——用于处理突变型和缓慢变化型环境下的非平稳多臂赌博机问题。该文建立了次线性期望累积遗憾边界,证明时间平均遗憾渐近收敛于零,且由于自适应窗口机制,SW-UCB# 的主导常数优于 LM-DSEE。

ABSTRACT

We study the non-stationary stochastic multiarmed bandit (MAB) problem and propose two generic algorithms, namely, the limited memory deterministic sequencing of exploration and exploitation (LM-DSEE) and the Sliding-Window Upper Confidence Bound# (SW-UCB#). We rigorously analyze these algorithms in abruptly-changing and slowly-varying environments and characterize their performance. We show that the expected cumulative regret for these algorithms under either of the environments is upper bounded by sublinear functions of time, i.e., the time average of the regret asymptotically converges to zero. We complement our analytic results with numerical illustrations.

研究动机与目标

  • 为解决多臂赌博机(MAB)算法在非平稳环境中,特别是奖励分布发生突变或渐变时的空白。
  • 开发在非平稳环境下仍能保持次线性期望累积遗憾的算法,确保长期性能随时间改善。
  • 提出适用于运动约束应用场景(如机器人轨迹规划)的确定性结构算法(LM-DSEE)。
  • 通过在 SW-UCB# 中引入随时间变化的窗口长度,缓解滑动窗口 UCB 方法对时域长度的依赖。
  • 为两种算法提供理论遗憾边界,并在不同非平稳场景下进行数值验证。

提出的方法

  • LM-DSEE 通过使用有限记忆窗口追踪近期奖励,并强制执行确定性探索-利用周期,将 DSEE 框架扩展至非平稳环境。
  • SW-UCB# 通过使用随时间变化的滑动窗口宽度替代固定窗口,改进了 SW-UCB,消除了对问题时域长度先验知识的需求。
  • 算法利用置信上界平衡探索与利用,置信区间基于 Hoeffding 不等式和集中不等式推导。
  • 遗憾分析利用 Bernstein 型不等式和尾概率边界,控制选择次优臂的概率。
  • 理论边界通过将遗憾分解为探索与利用两部分推导,同时仔细处理突变点和窗口化统计量。
  • 数值模拟采用具有 Beta 分布奖励的 10-臂赌博机,通过改变断点(突变型)和漂移率(缓慢型)验证性能。

实验结果

研究问题

  • RQ1像 LM-DSEE 这类确定性结构算法是否能在突变型和缓慢变化型 MAB 环境中保持次线性遗憾?
  • RQ2SW-UCB# 是否通过随时间自适应调整窗口长度,实现优于固定窗口 SW-UCB 的遗憾性能?
  • RQ3LM-DSEE 和 SW-UCB# 在非平稳设置下的期望累积遗憾理论上限是多少?
  • RQ4LM-DSEE 与 SW-UCB# 的遗憾边界主导常数有何差异,其原因是什么?
  • RQ5两种算法是否能在不依赖突变时间或时域长度先验知识的情况下,有效追踪奖励分布的变化?

主要发现

  • LM-DSEE 的期望累积遗憾上界为 $ O(T^{1 - \frac{\nu}{3}} \tfrac{\text{ln} T}{T}) $,其中 $ \nu $ 控制非平稳性的速率。
  • SW-UCB# 的期望累积遗憾上界为 $ O(T^{1 - \frac{\nu}{3}} \text{ln} T) $,且主导常数小于 LM-DSEE。
  • 两种算法在各类环境下的经验遗憾与理论边界的比值始终保持有界,验证了理论分析的正确性。
  • LM-DSEE 遗憾中的锯齿状模式归因于固定的探索周期,而 SW-UCB# 由于自适应窗口机制表现出更平滑的遗憾曲线。
  • 数值结果证实,两种算法均实现次线性遗憾,且在突变型与缓慢变化型环境中,时间平均遗憾均收敛至零。
  • 两种算法对非平稳性参数 $ \nu $ 和 $ \kappa $ 的变化均表现出鲁棒性,且 SW-UCB# 在主导常数方面始终优于 LM-DSEE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。