Skip to main content
QUICK REVIEW

[论文解读] Efficient Change-Point Detection for Tackling Piecewise-Stationary Bandits

Lilian Besson, Emilie Kaufmann|arXiv (Cornell University)|Feb 5, 2019
Advanced Bandit Algorithms Research参考文献 24被引用 18
一句话总结

该论文提出 GLR-klUCB,一种新颖的分段平稳多臂老虎机算法,结合 klUCB 与无需参数的伯努利广义似然比检验(GLRT)变化点检测器。该算法在无需事先知晓变化点数量或臂均值的情况下,实现了 $Ó(\sqrt{TA\Upsilon_T\ln T})$ 的遗憾,且在变化点分离良好、幅度较大的“简单”实例中,理论与实际表现均优于现有方法。

ABSTRACT

We introduce GLR-klUCB, a novel algorithm for the piecewise iid non-stationary bandit problem with bounded rewards. This algorithm combines an efficient bandit algorithm, kl-UCB, with an efficient, parameter-free, changepoint detector, the Bernoulli Generalized Likelihood Ratio Test, for which we provide new theoretical guarantees of independent interest. Unlike previous non-stationary bandit algorithms using a change-point detector, GLR-klUCB does not need to be calibrated based on prior knowledge on the arms' means. We prove that this algorithm can attain a $O(\sqrt{TA Υ_T\log(T)})$ regret in $T$ rounds on some "easy" instances, where A is the number of arms and $Υ_T$ the number of change-points, without prior knowledge of $Υ_T$. In contrast with recently proposed algorithms that are agnostic to $Υ_T$, we perform a numerical study showing that GLR-klUCB is also very efficient in practice, beyond easy instances.

研究动机与目标

  • 解决臂均值在未知时间点发生改变的非平稳多臂老虎机挑战。
  • 设计一种无需事先知晓变化点数量($\Upsilon_T$)或最小变化幅度($\Delta^{\text{change}}$)的老虎机算法。
  • 将鲁棒的老虎机策略(klUCB)与无需参数的变化点检测器(伯努利 GLRT)相结合,以提升理论与实际性能。
  • 证明该算法在变化点分离良好、幅度显著的“简单”实例中可实现近似最优遗憾。

提出的方法

  • 该算法采用 klUCB 老虎机策略进行臂的选择,该策略在随机老虎机中以优异的实验表现著称。
  • 它集成了伯努利广义似然比检验(GLRT)作为变化点检测器,用于在不依赖变化幅度下限的情况下识别臂奖励分布的突变。
  • 评估了两种重启机制:全局重启(在任一变化被检测到时重置所有臂)与局部重启(仅重置检测到变化的臂)。
  • 理论分析建立了全局重启下的遗憾界为 $\mathcal{O}(\sqrt{TA\Upsilon_T\ln T}/(\Delta^{\text{change}})^2)$,当 $\Delta^{\text{change}}$ 远离零时,该界简化为 $\mathcal{O}(\sqrt{TA\Upsilon_T\ln T})$。
  • 证明了 GLRT 检测器具有新的非渐近性质,具有独立兴趣,支持其在非平稳老虎机设置中的应用。
  • 该算法在合成的分段平稳环境以及使用 Yahoo! 新闻点击率数据的真实世界非平稳老虎机任务中进行了评估。

实验结果

研究问题

  • RQ1基于变化点检测的老虎机算法是否能在不事先知晓变化点数量($\Upsilon_T$)的情况下实现最优遗憾?
  • RQ2像伯努利 GLRT 这类无需参数的变化点检测器是否能有效集成到老虎机框架中,从而避免对臂均值估计的依赖?
  • RQ3所提出的算法 GLR-klUCB 是否能在包括违反分段平稳假设在内的多样化非平稳老虎机环境中保持强大的实验性能?
  • RQ4在非平稳设置(如非平稳衰减老虎机)中,GLR-klUCB 是否能在无需强制探索的情况下实现对数遗憾?

主要发现

  • 在全局重启下,GLR-klUCB 实现了 $\mathcal{O}(\sqrt{TA\Upsilon_T\ln T}/(\Delta^{\text{change}})^2)$ 的遗憾界,当 $\Delta^{\text{change}}$ 远离零时,该界与 Seznec 等人(2020)的下界仅相差一个 $\sqrt{\ln T}$ 因子。
  • 在数值实验中,当 $T=20000$,$K=5$,$\Upsilon=6$,$\Delta_{\min}=0.05$,$d_{\min}=1000$ 时,GLR-klUCB 全局重启的平均遗憾为 611,仅触发 3.1 次重启,优于其他基于 CPD 的算法。
  • 在真实世界的 Yahoo! 新闻点击率数据集上,采用局部重启且无强制探索的 GLR-klUCB 显著优于 Exp3.S 与 FEWA,且与状态先进的衰减老虎机算法 RAW-UCB 性能相当。
  • 该算法的遗憾曲线在出现大而孤立的变化时呈现对数形状,表明其在非递增分段老虎机问题中可能实现对数遗憾。
  • 尽管理论界限依赖于 $\Delta^{\text{change}}$,实验结果表明 GLR-klUCB 即使在并非所有变化均被检测到的“更难”实例中仍表现良好,显示出超越理论假设的鲁棒性。
  • 伯努利 GLRT 检测器被证明无需变化幅度下限即可有效工作,使该算法对臂均值值不敏感,相较于 CUSUM 或 M-UCB 更具实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。