Skip to main content
QUICK REVIEW

[论文解读] PG-TS: Improved Thompson Sampling for Logistic Contextual Bandits

Bianca Dumitrascu, Karen Feng|arXiv (Cornell University)|May 18, 2018
Advanced Bandit Algorithms Research参考文献 29被引用 11
一句话总结

本文提出PG-TS,一种用于逻辑回归上下文Bandit问题的新型Thompson Sampling算法,通过Pólya-Gamma扩展实现高效、完全贝叶斯的后验推断。通过使用带有Pólya-Gamma隐变量的Gibbs采样器,PG-TS在探索-利用平衡和收敛速度方面显著优于Laplace-TS和GLM-UCB,同时保持了计算效率。

ABSTRACT

We address the problem of regret minimization in logistic contextual bandits, where a learner decides among sequential actions or arms given their respective contexts to maximize binary rewards. Using a fast inference procedure with Polya-Gamma distributed augmentation variables, we propose an improved version of Thompson Sampling, a Bayesian formulation of contextual bandits with near-optimal performance. Our approach, Polya-Gamma augmented Thompson Sampling (PG-TS), achieves state-of-the-art performance on simulated and real data. PG-TS explores the action space efficiently and exploits high-reward arms, quickly converging to solutions of low regret. Its explicit estimation of the posterior distribution of the context feature covariance leads to substantial empirical gains over approximate approaches. PG-TS is the first approach to demonstrate the benefits of Polya-Gamma augmentation in bandits and to propose an efficient Gibbs sampler for approximating the analytically unsolvable integral of logistic contextual bandits.

研究动机与目标

  • 为解决在高维或非高斯上下文设置下,标准贝叶斯方法(如Laplace近似)在逻辑回归上下文Bandit问题中后验推断不可行的挑战。
  • 开发一种完全贝叶斯方法,实现模型参数和上下文特征协方差的精确后验估计,从而改善探索-利用权衡。
  • 首次将Pólya-Gamma扩展应用于Bandit算法,实现对分析上难以处理的后验分布的高效MCMC采样。
  • 在合成数据和真实世界数据(包括新闻推荐和森林覆盖类型预测)上评估PG-TS,以验证其经验优越性。

提出的方法

  • 引入Pólya-Gamma扩展,将难以处理的逻辑回归似然转化为条件共轭形式,从而支持高效的Gibbs采样。
  • 采用Gibbs采样器,通过迭代从模型参数和Pólya-Gamma隐变量的后验分布中抽样,利用条件共轭性。
  • 显式估计上下文特征的后验协方差,通过捕捉特征依赖关系提升探索性能,而Laplace-TS则假设特征间独立。
  • 采用批量更新进行模型推断,以匹配现实世界在线学习的约束,同时保持较低的计算开销。
  • 在模拟环境和真实世界数据集(包括Yahoo! Today Module和Forest Cover Type)上应用该方法,并采用无偏离线评估。
  • 提出PG-TS-stream作为流式变体,适用于低延迟部署,在保持性能的同时仅带来极小的计算成本。

实验结果

研究问题

  • RQ1Pólya-Gamma扩展能否被有效用于改进逻辑回归上下文Bandit问题中的后验采样?
  • RQ2显式估计上下文特征协方差是否能带来比Laplace近似更优的探索效果并降低遗憾?
  • RQ3PG-TS在合成数据和真实世界数据上与SOTA基线(如Laplace-TS和GLM-UCB)相比,其经验表现如何?
  • RQ4PG-TS能否在现实应用中常见的流式处理或延迟更新设置下保持优异性能?
  • RQ5Pólya-Gamma扩展在高维或非高斯特征设置下,对收敛速度和遗憾最小化有何影响?

主要发现

  • 在合成数据和真实世界数据(包括Forest Cover Type数据集)上,PG-TS在累积遗憾方面显著优于Laplace-TS和GLM-UCB。
  • 在Forest Cover Type数据集上,PG-TS实现了更低的遗憾和更快的收敛速度,与Laplace-TS相比在探索效率方面有显著提升,后者常陷入次优臂的困境。
  • 在Yahoo! Today Module新闻推荐任务中,PG-TS在所有延迟设置下均实现了比Laplace-TS更高的平均点击率(CTR),尤其在短延迟条件下收益最大。
  • PG-TS下顶级臂的抽样频率中位数显示了更均衡的探索行为,表明其能更有效地避免过早收敛至次优臂。
  • PG-TS-stream在计算开销极小的情况下保持了强劲性能,证明了其在流式部署中的可行性,且不损失准确性。
  • PG-TS中对上下文特征协方差的显式建模带来了更鲁棒和自适应的探索机制,尤其在高维或非高斯特征场景下,Laplace-TS表现欠佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。