Skip to main content
QUICK REVIEW

[论文解读] Latent Bandits Revisited

Joey Hong, Branislav Kveton|arXiv (Cornell University)|Jun 15, 2020
Advanced Bandit Algorithms Research参考文献 29被引用 11
一句话总结

本论文为潜在老虎机(latent bandits)提出了一种上下文上下文UCB和Thompson采样算法,明确考虑了模型不确定性和模型误设问题,从而实现更快、更鲁棒的潜在状态识别。当潜在状态数量小于动作数量时,该方法在合成数据和MovieLens 1M数据集上的实验表明,其遗憾(regret)低于经典老虎机策略,在平均和最坏情况用户场景下均表现出更优性能。

ABSTRACT

A latent bandit problem is one in which the learning agent knows the arm reward distributions conditioned on an unknown discrete latent state. The primary goal of the agent is to identify the latent state, after which it can act optimally. This setting is a natural midpoint between online and offline learning---complex models can be learned offline with the agent identifying latent state online---of practical relevance in, say, recommender systems. In this work, we propose general algorithms for this setting, based on both upper confidence bounds (UCBs) and Thompson sampling. Our methods are contextual and aware of model uncertainty and misspecification. We provide a unified theoretical analysis of our algorithms, which have lower regret than classic bandit policies when the number of latent states is smaller than actions. A comprehensive empirical study showcases the advantages of our approach.

研究动机与目标

  • 解决在用户意图或偏好未被观测但影响奖励的在线学习场景中潜在状态识别的挑战。
  • 设计对离线训练的奖励模型中模型误设和不确定性具有鲁棒性的上下文老虎机算法。
  • 在潜在老虎机框架中统一分析UCB和Thompson采样,并提供可证明的遗憾界。
  • 在冷启动和最坏情况个性化场景下,实证验证其相对于最先进基线方法的优越性。

提出的方法

  • 提出一种新颖的上下文UCB算法,其在潜在状态上维护置信区间而非动作,整合了离线学习模型参数的不确定性。
  • 引入一种Thompson采样变体,从潜在状态的后验分布中采样,使用以离线估计模型参数为中心的高斯先验,并利用经验协方差进行不确定性量化。
  • 利用UCB与后验采样之间的紧密联系,在亚高斯奖励假设下推导出统一的理论遗憾界。
  • 采用统一框架分析UCB与TS,实现模型误设情况下的理论比较与鲁棒性保证。
  • 采用低秩矩阵分解模型对用户和项目表征进行建模,通过历史数据离线训练以初始化潜在状态和奖励模型。
  • 未来工作中将引入折扣和滑动窗口技术,将框架扩展至非平稳潜在状态动态。

实验结果

研究问题

  • RQ1UCB和Thompson采样能否被适配到潜在老虎机设置中,以显式处理离线学习模型参数的不确定性?
  • RQ2当潜在状态数量小于动作数量时,考虑不确定性的算法与经典老虎机策略相比,在遗憾方面表现如何?
  • RQ3所提算法在冷启动和最坏情况用户场景下,对个性化速度和鲁棒性的提升程度如何?
  • RQ4能否为潜在老虎机框架中的UCB和Thompson采样建立统一的理论分析?

主要发现

  • 所提出的mmTS算法在MovieLens 1M数据集上的平均用户和最坏情况用户性能上均优于mTS和LinTS,显著提升了平均评分。
  • 即使在可访问完整电影向量信息的条件下,mmTS算法在长期奖励上也优于EXP4和LinUCB。
  • 在最差的10%用户中,mmTS的平均评分显著高于mTS,表明其对模型误设具有更强鲁棒性。
  • 当潜在状态数量小于动作数量时,所提算法的理论遗憾界低于经典老虎机策略。
  • 实证结果表明,考虑模型不确定性可实现更快、更可靠的潜在状态识别,尤其在冷启动场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。