Skip to main content
QUICK REVIEW

[论文解读] Thompson Sampling for Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms

Alihan Hüyük, Cem Tekin|arXiv (Cornell University)|Sep 7, 2018
Advanced Bandit Algorithms Research被引用 3
一句话总结

本文针对在半-bandit反馈下具有随机触发机制的组合多臂老虎机问题,提出了组合Thompson采样(CTS)。当奖励函数在基础臂的期望结果上满足Lipschitz连续性时,该文建立了O(∑ₘᵢ₌₁ log T / (pᵢΔᵢ))的遗憾界,实验结果表明CTS优于CUCB。

ABSTRACT

We analyze the regret of combinatorial Thompson sampling (CTS) for the combinatorial multi-armed bandit with probabilistically triggered arms under the semi-bandit feedback setting. We assume that the learner has access to an exact optimization oracle but does not know the expected base arm outcomes beforehand. When the expected reward function is Lipschitz continuous in the expected base arm outcomes, we derive $O(\sum_{i =1}^m \log T / (p_i \Delta_i))$ regret bound for CTS, where $m$ denotes the number of base arms, $p_i$ denotes the minimum non-zero triggering probability of base arm $i$ and $\Delta_i$ denotes the minimum suboptimality gap of base arm $i$. We also show that CTS outperforms combinatorial upper confidence bound (CUCB) via numerical experiments.

研究动机与目标

  • 分析组合Thompson采样(CTS)在具有随机触发机制的组合多臂老虎机问题中的遗憾性能。
  • 在期望奖励函数关于基础臂结果为Lipschitz连续的假设下,建立CTS在半-bandit反馈下的理论遗憾界。
  • 通过遗憾性能对比,实证评估CTS与组合上置信界(CUCB)的差异。
  • 研究触发概率与次优性差距对CTS遗憾界的影响。

提出的方法

  • CTS通过从基础臂期望结果的后验分布中采样来实现。
  • 该方法假设可访问精确的优化预言机,以在每轮中选择最优的组合臂。
  • 奖励函数被假设为在期望基础臂结果上满足Lipschitz连续性,以确保遗憾分析的平滑性。
  • 遗憾界通过集中不等式以及触发概率和次优性差距的性质推导得出。
  • 分析考虑了概率触发机制,即选择部分臂可能随机触发额外的奖励。
  • 数值实验在相同设置下对比了CTS与CUCB的遗憾性能,以评估其经验表现。

实验结果

研究问题

  • RQ1在具有随机触发机制的设定下,组合Thompson采样(CTS)的理论遗憾界是什么?
  • RQ2奖励函数的Lipschitz连续性如何影响CTS的遗憾性能?
  • RQ3在遗憾性能方面,CTS与组合上置信界(CUCB)相比如何?
  • RQ4最小触发概率(pᵢ)与次优性差距(Δᵢ)在遗憾界中起什么作用?
  • RQ5在相同的反馈与优化约束条件下,CTS能否实现优于CUCB的遗憾性能?

主要发现

  • 在给定假设下,本文建立了CTS的O(∑ₘᵢ₌₁ log T / (pᵢΔᵢ))遗憾界。
  • 遗憾界依赖于每个基础臂的最小非零触发概率(pᵢ)的倒数及其次优性差距(Δᵢ)。
  • 数值实验表明CTS优于CUCB,表明其具有更优的经验性能。
  • 理论遗憾界是在奖励函数关于基础臂期望结果满足Lipschitz连续性的假设下推导得出的。
  • 分析在半-bandit反馈下成立,即被触发臂的奖励可单独观测。
  • 结果表明,与现有方法相比,CTS在相同条件下可实现更紧的遗憾界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。