Skip to main content
QUICK REVIEW

[论文解读] Contextual Combinatorial Bandits with Probabilistically Triggered Arms

Xutong Liu, Jinhang Zuo|arXiv (Cornell University)|Mar 30, 2023
Advanced Bandit Algorithms ResearchDecision Sciences被引用 3
一句话总结

本文提出了具有概率触发臂的上下文组合多臂老虎机(C²MAB-T),提出C²-UCB-T与VAC²-UCB算法以在平滑性条件下实现遗憾最小化。在触发概率调制(TPM)条件下,该方法实现了$\tilde{O}(d\sqrt{KT})$的遗憾界;在方差调制(VM)或TPVM条件下,遗憾界提升至$\tilde{O}(d\sqrt{T})$,消除了对$K$和$1/p_{\min}$的依赖,并通过合成数据与真实世界数据的实证验证。

ABSTRACT

We study contextual combinatorial bandits with probabilistically triggered arms (C$^2$MAB-T) under a variety of smoothness conditions that capture a wide range of applications, such as contextual cascading bandits and contextual influence maximization bandits. Under the triggering probability modulated (TPM) condition, we devise the C$^2$-UCB-T algorithm and propose a novel analysis that achieves an $ ilde{O}(d\sqrt{KT})$ regret bound, removing a potentially exponentially large factor $O(1/p_{\min})$, where $d$ is the dimension of contexts, $p_{\min}$ is the minimum positive probability that any arm can be triggered, and batch-size $K$ is the maximum number of arms that can be triggered per round. Under the variance modulated (VM) or triggering probability and variance modulated (TPVM) conditions, we propose a new variance-adaptive algorithm VAC$^2$-UCB and derive a regret bound $ ilde{O}(d\sqrt{T})$, which is independent of the batch-size $K$. As a valuable by-product, our analysis technique and variance-adaptive algorithm can be applied to the CMAB-T and C$^2$MAB setting, improving existing results there as well. We also include experiments that demonstrate the improved performance of our algorithms compared with benchmark algorithms on synthetic and real-world datasets.

研究动机与目标

  • 为具有概率触发臂的上下文组合多臂老虎机(C²MAB-T)建立一个通用框架,以建模包括级联多臂老虎机和影响力最大化在内的多样化应用场景。
  • 解决先前研究的局限性,即要么假设确定性反馈,要么遗憾界中包含$1/p_{\min}$或$K$的次优项。
  • 设计在现实平滑性条件(如方差调制)下,遗憾界与$K$无关的算法。
  • 提供一种精细化分析,消除先前结果中普遍存在的$O(1/p_{\min})$因子,从而提升可扩展性与性能。

提出的方法

  • 在触发概率调制(TPM)条件下提出C²-UCB-T算法,采用新颖分析方法,实现$\tilde{O}(d\sqrt{KT})$遗憾界,且不包含$1/p_{\min}$因子。
  • 在方差调制(VM)或触发概率与方差调制(TPVM)条件下提出自适应方差的VAC²-UCB算法,实现与$K$无关的$\tilde{O}(d\sqrt{T})$遗憾界。
  • 采用新型置信区间设计,使其能自适应臂结果的方差,从而实现更紧致的遗憾分析。
  • 使用时变特征映射$\bm{\phi}_t$建模上下文信息,并假设在$\theta^*$上线性化期望奖励,确保可扩展性。
  • 应用概率触发臂机制以推广反馈模型,涵盖半多臂老虎机、级联多臂老虎机及概率反馈等情形。
  • 通过精细化分析期望奖励差距与臂采样次数,结合奖励函数的平滑性条件,推导出遗憾界。

实验结果

研究问题

  • RQ1我们能否设计一种上下文组合多臂老虎机框架,以泛化现有模型(如级联多臂老虎机和影响力最大化)的同时保持可扩展性?
  • RQ2在现实平滑性假设下,是否仍可实现与批次大小$K$和最小触发概率$p_{\min}$无关的遗憾界?
  • RQ3在具有概率触发臂的场景中,自适应方差算法是否能优于以往保守探索策略,从而改善遗憾性能?
  • RQ4所提出的分析技术如何消除以往组合多臂老虎机方法中普遍存在的$O(1/p_{\min})$因子?
  • RQ5该新算法与分析框架在多大程度上可扩展至改进CMAB-T与C²MAB中的现有结果?

主要发现

  • C²-UCB-T算法在TPM条件下实现了$\tilde{O}(d\sqrt{KT})$的遗憾界,且消除了先前工作中存在的$O(1/p_{\min})$因子。
  • VAC²-UCB算法在VM或TPVM条件下实现了$\tilde{O}(d\sqrt{T})$的遗憾界,且与批次大小$K$无关。
  • 所提出分析技术与自适应方差设计可推广至CMAB-T与C²MAB,从而改进这些场景下的现有遗憾界。
  • 在合成数据与真实世界数据上的实证结果表明,所提算法相比基线方法表现出更优性能。
  • 改进的遗憾界源于对期望奖励差距的更紧致分析,以及与方差自适应的置信区间设计。
  • 该框架成功泛化至上下文级联多臂老虎机与影响力最大化多臂老虎机等应用场景,并提供可证明的保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。