Skip to main content
QUICK REVIEW

[论文解读] Generalized Thompson Sampling for Contextual Bandits

Lihong Li|arXiv (Cornell University)|Oct 27, 2013
Advanced Bandit Algorithms Research参考文献 17被引用 17
一句话总结

本文提出广义汤普森采样(GTS),这是一种新型的上下文Bandit算法族,通过使用可定制的损失函数,在专家学习框架下统一了汤普森采样。通过利用损失函数的自有有界性——特别是平方损失和对数损失——推导出明确量化先验分布对学习性能影响的遗憾界,为现有方法提供了一种理论基础坚实且灵活的替代方案。

ABSTRACT

Thompson Sampling, one of the oldest heuristics for solving multi-armed bandits, has recently been shown to demonstrate state-of-the-art performance. The empirical success has led to great interests in theoretical understanding of this heuristic. In this paper, we approach this problem in a way very different from existing efforts. In particular, motivated by the connection between Thompson Sampling and exponentiated updates, we propose a new family of algorithms called Generalized Thompson Sampling in the expert-learning framework, which includes Thompson Sampling as a special case. Similar to most expert-learning algorithms, Generalized Thompson Sampling uses a loss function to adjust the experts' weights. General regret bounds are derived, which are also instantiated to two important loss functions: square loss and logarithmic loss. In contrast to existing bounds, our results apply to quite general contextual bandits. More importantly, they quantify the effect of the "prior" distribution on the regret bounds.

研究动机与目标

  • 为解决现有方法中缺乏明确量化先验分布在一般上下文Bandit中汤普森采样作用的理论遗憾界的问题。
  • 开发一个统一框架,将汤普森采样推广至非参数假设之外,基于专家学习范式。
  • 推导适用于非线性和一般上下文Bandit设置的遗憾界,且不依赖于对先验正确性或似然分布的强假设。
  • 通过损失函数建立汤普森采样与指数更新规则之间的联系,从而实现更广泛的理论分析。

提出的方法

  • 在专家学习框架中提出广义汤普森采样(GTS)作为算法族,其中每位专家代表一种上下文策略用于动作选择。
  • 使用损失函数根据对期望奖励预测准确性的程度来更新专家权重,当使用对数损失时,汤普森采样即为特例。
  • 应用损失函数的新型自有有界性性质推导遗憾界,对平方损失和对数损失进行了严格分析。
  • 推导出显式包含先验分布对学习性能影响的问题依赖型遗憾界。
  • 采用基于损失随机变量矩界的竞争性分析技术,关键引理证明了对数损失的自有有界性。
  • 通过覆盖论证将框架扩展至连续专家类,表明其适用范围超越有限专家集合。

实验结果

研究问题

  • RQ1如何将汤普森采样推广至一般上下文Bandit设置,以提供超越参数模型的理论遗憾界?
  • RQ2先验分布对上下文Bandit学习中遗憾的影响有多大?如何在边界中正式刻画这种影响?
  • RQ3能否开发一个统一框架,将汤普森采样与基于损失的专家加权的专家学习算法联系起来?
  • RQ4损失函数的哪些性质能够实现在线学习和上下文Bandit中紧致的遗憾分析?如何对这些性质进行形式化表征?

主要发现

  • 广义汤普森采样实现了 $ O(T^{2/3}) $ 阶的遗憾界,这是首个明确量化先验分布影响的通用上下文Bandit类的遗憾界。
  • 本工作首次证明了对数损失的自有有界性,其中偏移损失的方差与均值之比被一个与真实和预测概率无关的常数所界定。
  • 对于对数损失,分析表明在有界对数比条件下,$ M_2 / M_1 = O(1) $,其中 $ M_1 $ 和 $ M_2 $ 分别为损失的一阶和二阶矩。
  • 遗憾界通过先验对专家的分布体现其影响,分析结合了贝叶斯先验与频率学派鲁棒性的优势,类似于PAC-Bayes界。
  • 该框架将汤普森采样推广至标准贝叶斯更新之外,允许使用任意损失函数来指导专家权重的更新。
  • 与需要昂贵平衡分布计算的类似算法(如回归器消除)相比,该方法在计算上更为高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。