Skip to main content
QUICK REVIEW

[论文解读] Contextual Combinatorial Conservative Bandits

Xiaojin Zhang, Shuai Li|arXiv (Cornell University)|Nov 26, 2019
Advanced Bandit Algorithms Research参考文献 35被引用 4
一句话总结

本文提出了一种新型上下文组合保守多臂老虎机框架,其中智能体在每轮中选择多个臂,同时确保即时奖励安全。该文提出了两种基于UCB的算法——一种针对已知保守奖励,另一种针对未知保守奖励,实现了 $\tilde{O}(d^2 + d\sqrt{T})$ 的遗憾界,在高维设置下比以往工作更紧致。

ABSTRACT

The problem of multi-armed bandits (MAB) asks to make sequential decisions while balancing between exploitation and exploration, and have been successfully applied to a wide range of practical scenarios. Various algorithms have been designed to achieve a high reward in a long term. However, its short-term performance might be rather low, which is injurious in risk sensitive applications. Building on previous work of conservative bandits, we bring up a framework of contextual combinatorial conservative bandits. An algorithm is presented and a regret bound of $ ilde O(d^2+d\sqrt{T})$ is proven, where $d$ is the dimension of the feature vectors, and $T$ is the total number of time steps. We further provide an algorithm as well as regret analysis for the case when the conservative reward is unknown. Experiments are conducted, and the results validate the effectiveness of our algorithm.

研究动机与目标

  • 为解决组合与上下文多臂老虎机设置中缺乏即时安全保证的问题,特别是在风险敏感的应用中。
  • 将保守多臂老虎机框架扩展至上下文组合设置,其中同时选择多个臂且奖励函数为非线性。
  • 设计计算高效的算法,在每一步时间都保持安全的同时最大化长期奖励。
  • 在高维特征空间中,相较于以往的保守多臂老虎机方法,提供更紧致的遗憾界。
  • 处理保守奖励阈值已知与未知两种情况,确保在实际部署中的鲁棒性。

提出的方法

  • 提出一种上下文组合保守多臂老虎机框架,其中智能体根据上下文特征每轮选择最多 $K$ 个臂,并接收半-bandit 反馈。
  • 设计一种基于UCB的算法(CCConUCB),通过为每轮预期累积奖励设置下界来维持保守奖励约束。
  • 对臂集合 $A$ 和上下文 $w$ 使用非线性奖励函数 $f(A,w)$,满足两个温和假设(如有界性和光滑性)。
  • 引入一种保守策略,确保所选臂集合的预期奖励至少为保守基线的 $1-\alpha$,即使在早期轮次也成立。
  • 采用一种新颖的遗憾分析技术,推导出高维上下文下更紧致的遗憾界 $\tilde{O}(d^2 + d\sqrt{T})$,优于以往的 $O(d\sqrt{T}\log T + (d\log d)^2)$。
  • 将算法适配至保守奖励未知的情形,通过历史数据估计基线奖励,并利用置信区间保持安全性。

实验结果

研究问题

  • RQ1能否设计一种上下文组合多臂老虎机算法,在最大化长期累积奖励的同时保持即时奖励安全?
  • RQ2如何将保守多臂老虎机原则扩展至具有非线性奖励函数的组合动作集?
  • RQ3在高维上下文设置下,保守算法的理论遗憾性能如何?
  • RQ4与非保守对应算法相比,该算法在约束违反次数和遗憾方面表现如何?
  • RQ5保守系数 $\alpha$ 如何影响收敛速度以及超越纯保守策略所需的时间?

主要发现

  • 所提出的 CCConUCB 算法在每一轮时间步均成功将累积奖励维持在保守基线的 $1-\alpha$ 以上,即使在早期轮次也成立。
  • 该算法实现了 $\tilde{O}(d^2 + d\sqrt{T})$ 的遗憾界,相较于以往工作在高维设置下的 $O(d\sqrt{T}\log T + (d\log d)^2)$ 更为紧致。
  • 当退化为标准上下文多臂老虎机($K=1$)时,遗憾界变为 $O(d\sqrt{T} + d^{3/2})$,优于文献[15]中 $O(d\sqrt{T}\log T + (d\log d)^2)$ 的结果。
  • 数值模拟表明,CCConUCB 在避免约束违反的同时,遗憾水平低于非保守UCB算法,尤其当 $\alpha$ 较小时表现更优。
  • 当 $\alpha$ 较大时,算法收敛更快,且能更早超越纯保守策略,原因在于探索机会更多。
  • 当 $\alpha$ 较小时,智能体探索更少,遗憾恶化更慢,但仍能有效避免大的约束违反,展现出强大的安全保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。