Skip to main content
QUICK REVIEW

[论文解读] Analysis of Thompson Sampling for Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms

Alihan Hüyük, Cem Tekin|arXiv (Cornell University)|Sep 7, 2018
Advanced Bandit Algorithms Research被引用 8
一句话总结

本文分析了在半反馈机制下,针对具有概率触发机制的组合多臂赌博机(CMAB-PTA)问题的组合Thompson采样(CTS)方法。在期望奖励函数满足Lipschitz连续性的条件下,建立了$O\left(\sum_{i=1}^{m}\frac{\log T}{p_i\Delta_i}\right)$阶次最优的遗憾界,其中$p_i$为基臂$i$的最小非零触发概率,$\Delta_i$为基臂$i$的次优性差距。

ABSTRACT

We analyze the regret of combinatorial Thompson sampling (CTS) for the combinatorial multi-armed bandit with probabilistically triggered arms under the semi-bandit feedback setting. We assume that the learner has access to an exact optimization oracle but does not know the expected base arm outcomes beforehand. When the expected reward function is Lipschitz continuous in the expected base arm outcomes, we derive $O(\\sum_{i =1}^m \\log T / (p_i \\Delta_i))$ regret bound for CTS, where $m$ denotes the number of base arms, $p_i$ denotes the minimum non-zero triggering probability of base arm $i$ and $\\Delta_i$ denotes the minimum suboptimality gap of base arm $i$. We also compare CTS with combinatorial upper confidence bound (CUCB) via numerical experiments on a cascading bandit problem.

研究动机与目标

  • 分析组合Thompson采样(CTS)在具有概率触发机制的组合多臂赌博机(CMAB-PTA)中的遗憾性能。
  • 在不假设单调性的情况下,建立当期望奖励函数关于基臂结果呈Lipschitz连续时,CTS的遗憾界。
  • 通过数值实验,比较CTS与组合UCB(CUCB)在遗憾性能上的差异。
  • 通过与已知的CMAB-PTA遗憾下界对比,证明所推导的遗憾界是紧致的。
  • 探究在此设置下,实现次线性遗憾是否必须依赖精确优化预言机。

提出的方法

  • 本文建模CMAB-PTA问题,其中选择一个超臂会以概率触发基臂,且仅能观测到被触发的基臂的反馈。
  • 假设学习者可访问一个精确优化预言机,该预言机可根据基臂的期望结果返回最优超臂。
  • 假设期望奖励函数关于基臂期望结果的向量呈Lipschitz连续。
  • 通过从基臂结果的后验分布中进行采样,并选择在采样结果上期望奖励最大的超臂,来应用CTS。
  • 利用集中不等式进行遗憾分析,并通过后验采样来界定选择次优超臂的概率。
  • 分析中考虑了每个基臂$i$的触发概率$p_i$,其影响观测频率,从而影响学习速率。

实验结果

研究问题

  • RQ1在具有概率触发机制的组合多臂赌博机中,组合Thompson采样(CTS)的遗憾性能如何?
  • RQ2在期望奖励函数满足Lipschitz连续性时,CTS能否实现阶次最优的遗憾界?
  • RQ3每个基臂的最小触发概率$p_i$如何影响CTS的遗憾界?
  • RQ4在不同触发动态的级联赌博机问题中,CTS与CUCB在遗憾性能上的表现如何比较?
  • RQ5在一般CMAB-PTA设置下,遗憾界中的$1/p_i$依赖关系是否不可避免?

主要发现

  • 本文推导出CTS的遗憾界为$O\left(\sum_{i=1}^{m}\frac{1}{p_i\Delta_i}\log T\right)$,该界为阶次最优,并与CMAB-PTA的已知遗憾下界一致。
  • 遗憾界依赖于$1/p_i$,其中$p_i$为基臂$i$的最小非零触发概率,表明稀有触发事件会减缓学习过程。
  • 在析取级联赌博机问题上的数值实验表明,由于探索效率更高,CTS显著优于CUCB。
  • 在存在一个坏臂的合取级联赌博机设置中,由于UCB指数较高,CUCB初期优于CTS,但随着后验采样趋于准确,CTS最终超越CUCB。
  • 先前研究中的匹配下界表明,遗憾界中的$1/p_i$项在一般情况下不可避免。
  • 只有当学习者可访问精确优化预言机时,CTS才能实现次线性遗憾;若使用近似预言机,则遗憾会无界增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。