Skip to main content
QUICK REVIEW

[论文解读] Stochastic Bandits with Delay-Dependent Payoffs

Leonardo Cella, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|Oct 7, 2019
Advanced Bandit Algorithms Research参考文献 23被引用 4
一句话总结

本文提出了一种非平稳随机多臂赌博机模型 B2DEP,其中每次拉取某根杠杆后,其期望奖励随距离上次拉取的时间增加而上升,该模型受音乐推荐系统启发。论文提出了一类基于基线奖励对前 r 根杠杆进行循环的排序策略,并证明其遗憾界为 $\widetilde{\mathcal{O}}(\sqrt{kT})$,且策略切换次数仅为 $\mathcal{O}(k\ln\ln T)$,同时表明该策略类可近似最优策略,误差在常数因子内。

ABSTRACT

Motivated by recommendation problems in music streaming platforms, we propose a nonstationary stochastic bandit model in which the expected reward of an arm depends on the number of rounds that have passed since the arm was last pulled. After proving that finding an optimal policy is NP-hard even when all model parameters are known, we introduce a class of ranking policies provably approximating, to within a constant factor, the expected reward of the optimal policy. We show an algorithm whose regret with respect to the best ranking policy is bounded by $\widetilde{\mathcal{O}}\big(\!\sqrt{kT}\big)$, where $k$ is the number of arms and $T$ is time. Our algorithm uses only $\mathcal{O}\big(k\ln\ln T\big)$ switches, which helps when switching between policies is costly. As constructing the class of learning policies requires ordering the arms according to their expectations, we also bound the number of pulls required to do so. Finally, we run experiments to compare our algorithm against UCB on different problem instances.

研究动机与目标

  • 说明在现实世界推荐系统(如音乐流媒体平台)中,用户参与度会因反复接触相同内容而下降,因此需要非平稳赌博机模型。
  • 解决在非平稳环境中学习最优策略的挑战,其中奖励取决于距离上次拉取的时间,且该问题被证明为 NP-难。
  • 提出一类受限的排序策略——按基线奖励顺序循环选择前 $r$ 根杠杆——并证明其期望奖励可被证明在最优策略奖励的常数因子之内。
  • 设计一种学习算法,以最小化相对于最优排序策略的遗憾,同时控制策略切换次数,因为实际应用中切换成本较高。
  • 通过实验表明,所提算法在存在切换成本的场景下优于标准 UCB 算法,尤其在次优性差距较小时表现更优。

提出的方法

  • 形式化 B2DEP 模型,其中每根杠杆 $i$ 拥有基线奖励 $\mu_i$ 和延迟参数 $d_i$,使得期望奖励 $\mu_i(\tau)$ 随 $\tau$(自上次拉取以来的轮数)增加而上升,并在 $\tau > d_i$ 时稳定在 $\mu_i$。
  • 引入一类排序策略 $\Pi_{\mathcal{K}}$,其按 $\mu_i$ 顺序循环选择基线奖励最高的 $r$ 根杠杆,并证明该策略类可近似最优策略,误差在常数因子内。
  • 设计一种基于 UCB1 的学习算法,仅使用每种策略的第二次运行结果来计算奖励估计值,以确保校准性并减少先前策略历史带来的偏差。
  • 实现一种变体 $\pi_{\mathrm{low}}$,其限制探索并减少切换频率,从而降低切换成本,同时保持 $\widetilde{\mathcal{O}}(\sqrt{kT})$ 的遗憾界。
  • 使用一种虚拟策略 $\pi_{\mathrm{ghost}}$ 来估计每种排序策略的期望奖励,从而在实验中实现与最优策略的比较。
  • 应用加倍技巧或类似方法,以消除对 $T$ 的先验知识依赖,使算法无需预先知道时间范围即可运行。

实验结果

研究问题

  • RQ1在 B2DEP 模型中,即使所有参数均已知,寻找最优周期性策略是否为 NP-难问题?
  • RQ2能否证明一类受限的排序策略——即按基线奖励顺序循环选择前 $r$ 根杠杆——可实现最优策略期望奖励的常数因子近似?
  • RQ3能否设计一种学习算法,使其相对于最优排序策略的遗憾为次线性,同时最小化策略切换次数?
  • RQ4所提算法在遗憾和切换成本方面与标准 UCB 相比表现如何,尤其在次优性差距较小时?
  • RQ5在何种条件下,在两个表现良好的策略之间切换,会优于始终使用单一最优策略?这又如何影响遗憾?

主要发现

  • 通过归约至周期性维护调度问题,证明了在 B2DEP 模型中寻找最优周期性策略的问题即使在所有模型参数已知的情况下也是 NP-难的。
  • 按基线奖励期望顺序循环选择前 $r$ 根杠杆的排序策略类,其期望奖励可被证明在最优策略奖励的常数因子之内。
  • 所提学习算法相对于最优排序策略的遗憾界为 $\widetilde{\mathcal{O}}(\sqrt{kT})$,其中 $k$ 为杠杆数量,$T$ 为时间范围。
  • 策略切换次数被限制在 $\mathcal{O}(k\ln\ln T)$,在策略切换成本较高的场景下具有显著优势。
  • 实验表明,$\pi_{\mathrm{low}}$(限制切换次数)在存在切换成本时优于 UCB,尤其在次优性差距较小时表现更优。
  • 事实 1 确认:当两种排序策略的性能完全相同时,交替使用它们可获得比单独使用任一策略更高的平均期望奖励。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。