Skip to main content
QUICK REVIEW

[论文解读] Statistical Efficiency of Thompson Sampling for Combinatorial Semi-Bandits

Pierre Perrault, Étienne Boursier|arXiv (Cornell University)|Jun 11, 2020
Advanced Bandit Algorithms Research参考文献 36被引用 7
一句话总结

本文首次对具有半反馈的随机组合多臂赌博机中的组合贝叶斯采样(CTS)建立了紧致的遗憾分析,涵盖两种关键设置:使用贝塔先验的 [0,1] 区间内相互独立的结果,以及使用高斯先验的多变量次高斯结果。结果表明,CTS 在对数因子范围内实现了最优渐近遗憾,为最优但计算不可行的 ESCB 策略提供了一种计算高效的替代方案。

ABSTRACT

We investigate stochastic combinatorial multi-armed bandit with semi-bandit feedback (CMAB). In CMAB, the question of the existence of an efficient policy with an optimal asymptotic regret (up to a factor poly-logarithmic with the action size) is still open for many families of distributions, including mutually independent outcomes, and more generally the multivariate sub-Gaussian family. We propose to answer the above question for these two families by analyzing variants of the Combinatorial Thompson Sampling policy (CTS). For mutually independent outcomes in $[0,1]$, we propose a tight analysis of CTS using Beta priors. We then look at the more general setting of multivariate sub-Gaussian outcomes and propose a tight analysis of CTS using Gaussian priors. This last result gives us an alternative to the Efficient Sampling for Combinatorial Bandit policy (ESCB), which, although optimal, is not computationally efficient.

研究动机与目标

  • 通过建立紧致的遗憾界,填补组合半反馈贝叶斯采样理论理解上的空白。
  • 分析在使用贝塔先验时,[0,1] 区间内相互独立结果下的 CTS,实现最优遗憾量级。
  • 将分析扩展至使用高斯先验的多变量次高斯结果,为 ESCB 提供一种计算高效的替代方案。
  • 证明 CTS 在对数因子范围内实现最优渐近遗憾,与信息论下界一致。

提出的方法

  • 提出一种使用贝塔先验的组合贝叶斯采样(CTS)变体,用于处理独立的 [0,1] 有界结果。
  • 引入一种基于反向分摊和事件过滤的新颖分析框架,以界定期望遗憾。
  • 利用由高斯先验导出的椭球置信区域,以建模多变量次高斯结果。
  • 应用反向分摊技术,控制最优与次优臂之间差距较小时的回合对遗憾的贡献。
  • 采用组合奖励分解方法,对差距较小事件下的遗憾进行有界控制。
  • 通过积分近似和利用置信区间宽度的反函数控制尾部概率,推导出遗憾界。

实验结果

研究问题

  • RQ1在具有独立结果的组合半反馈贝叶斯采样中,贝叶斯采样能否实现最优渐近遗憾?
  • RQ2使用贝塔先验的 CTS 是否能实现与信息论下界一致的紧致遗憾界?
  • RQ3在多变量次高斯设定下,使用高斯先验的 CTS 是否能实现最优遗憾,同时保持计算效率?
  • RQ4与最优但计算昂贵的 ESCB 相比,CTS 的遗憾表现如何?

主要发现

  • 对于独立的 [0,1]-有界结果,使用贝塔先验的 CTS 实现了 O(n log T / Δ) 量级的遗憾界,与信息论下界在对数因子范围内一致。
  • 对于多变量次高斯结果,使用高斯先验的 CTS 实现了最优遗憾量级,为 ESCB 策略提供了一种计算高效的替代方案。
  • 分析证明,CTS 的期望遗憾上界为 O(∑ᵢ βᵢ,ₜ / (m Δᵢ,ₘᵢₙ))(ℓ₁ 范数误差),其中 βᵢ,ₜ 的选择用于控制置信区间的宽度。
  • 反向分摊技术能够对小差距回合的遗憾贡献实现紧密控制,从而实现对最小差距 Δ 的最优依赖。
  • 所提出的方法在无需复杂优化的情况下实现最优遗憾量级,而 ESCB 虽然最优但对大规模问题不可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。