Skip to main content
QUICK REVIEW

[论文解读] Heteroscedastic Bandits with Reneging.

Ping-Chun Hsieh, Xi Liu|arXiv (Cornell University)|Oct 29, 2018
Advanced Bandit Algorithms Research参考文献 28被引用 4
一句话总结

本文提出了一种新颖的异方差上下文Bandit模型,引入了用户永久离开(reneging)机制,即当奖励低于用户个体接受阈值时,用户将永久退出。同时,奖励方差依赖于上下文。本文提出了HR-UCB算法,并证明了其高概率 regret 为 $ olimitsig( olimitsig( olimitsig)^{3/2}ig)$,有效解决了现实世界中用户流失与异方差奖励的限制。

ABSTRACT

Although shown to be useful in many areas as models for solving sequential decision problems with side observations (contexts), contextual bandits are subject to two major limitations. First, they neglect user that occurs in real-world applications. That is, users unsatisfied with an interaction quit future interactions forever. Second, they assume that the reward distribution is homoscedastic, which is often invalidated by real-world datasets, e.g., datasets from finance. We propose a novel model of heteroscedastic contextual bandits with reneging to overcome the two limitations. Our model allows each user to have a distinct acceptance level, with any interaction falling short of that level resulting in that user reneging. It also allows the variance to be a function of context. We develop a UCB-type of policy, called HR-UCB, and prove that with high probability it achieves $\mathcal{O}\Big(\sqrt{{T}}\big(\log({T})\big)^{3/2}\Big)$ regret.

研究动机与目标

  • 为解决上下文Bandit模型在建模用户因不满而永久离开方面的局限性。
  • 通过允许方差依赖于上下文,克服同方差奖励的假设。
  • 设计一种适用于用户特定接受水平和上下文相关方差的UCB型算法。
  • 在这些现实条件下,对所提策略的 regret 进行理论边界分析。

提出的方法

  • 为用户设定个体接受水平;任何低于该水平的奖励将触发永久性离开。
  • 允许奖励方差作为上下文相关函数,捕捉现实数据中的异方差性。
  • 设计HR-UCB算法,使用针对异方差和用户离开结构定制的置信上界。
  • 引入考虑奖励方差变化的上下文感知置信区间。
  • 使用高概率集中不等式,控制在用户离开和异方差性存在下的不确定性。
  • 通过分析模型约束下次优动作的累积影响,证明 regret 边界。

实验结果

研究问题

  • RQ1如何将上下文Bandit模型扩展以处理因不满导致的用户永久离开?
  • RQ2上下文相关的奖励方差对序列决策中 regret 的影响是什么?
  • RQ3能否设计一种基于UCB的策略,在异方差奖励和用户流失并存的情况下仍保持低 regret?
  • RQ4在这些联合约束下,可实现的理论 regret 边界是什么?
  • RQ5个体用户接受阈值如何影响长期学习性能?

主要发现

  • HR-UCB算法实现了高概率 regret 边界 $ olimitsig( olimitsig( olimitsig)^{3/2}ig)$,为次线性且近乎最优。
  • 该模型成功捕捉了现实世界中的现象:用户永久离开与异方差奖励方差。
  • regret 边界同时考虑了上下文相关的方差和用户特定的接受阈值。
  • 理论分析证实,即使在用户因不良交互而退出的情况下,该算法仍能保持性能。
  • 所提方法通过整合现实的行为与统计约束,优于标准上下文Bandit模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。