Skip to main content
QUICK REVIEW

[论文解读] Horde of Bandits using Gaussian Markov Random Fields

Sharan Vaswani, Mark Schmidt|arXiv (Cornell University)|Mar 7, 2017
Advanced Bandit Algorithms Research被引用 5
一句话总结

本文提出了一种可扩展的上下文多臂老虎机框架——'多臂老虎机群'(Horde of Bandits),利用高斯马尔可夫随机场(GMRFs)对社交图中的用户偏好依赖关系进行建模。通过利用GMRF推理和基于扰动的采样方法实现汤普森采样,该方法实现了次线性遗憾,且在无需限制性聚类假设的前提下,可高效扩展至大规模图结构,在实验中优于忽略图结构和基于聚类的方法。

ABSTRACT

The gang of bandits (GOB) model \cite{cesa2013gang} is a recent contextual bandits framework that shares information between a set of bandit problems, related by a known (possibly noisy) graph. This model is useful in problems like recommender systems where the large number of users makes it vital to transfer information between users. Despite its effectiveness, the existing GOB model can only be applied to small problems due to its quadratic time-dependence on the number of nodes. Existing solutions to combat the scalability issue require an often-unrealistic clustering assumption. By exploiting a connection to Gaussian Markov random fields (GMRFs), we show that the GOB model can be made to scale to much larger graphs without additional assumptions. In addition, we propose a Thompson sampling algorithm which uses the recent GMRF sampling-by-perturbation technique, allowing it to scale to even larger problems (leading to a "horde" of bandits). We give regret bounds and experimental results for GOB with Thompson sampling and epoch-greedy algorithms, indicating that these methods are as good as or significantly better than ignoring the graph or adopting a clustering-based approach. Finally, when an existing graph is not available, we propose a heuristic for learning it on the fly and show promising results.

研究动机与目标

  • 为解决原始'多臂老虎机群'(GOB)模型在用户数量上存在二次时间复杂度的可扩展性限制。
  • 在大规模推荐系统中实现用户间高效的信息传递,且不施加不切实际的聚类假设。
  • 为GOB模型开发一种汤普森采样变体,利用GMRF的基于扰动的采样技术实现对大规模图结构的可扩展性。
  • 提出一种启发式方法,用于在图结构未预先提供的情况下,联合学习用户图与偏好。
  • 建立理论遗憾边界,并通过实证验证其相对于基线方法和基于聚类方法的性能提升。

提出的方法

  • 将GOB模型重新表述为高斯马尔可夫随机场(GMRF),其中用户图定义了用户偏好先验的精度矩阵(协方差逆矩阵)。
  • 在GMRF框架中使用最大后验估计(MAP)方法,结合稀疏图的线性时间求解器,高效推断用户偏好。
  • 提出一种汤普森采样算法,利用GMRF文献中基于扰动的采样技术,高效生成后验样本。
  • 采用基于扰动的采样方法,避免完整的矩阵求逆,从而实现对大规模问题的可扩展性。
  • 应用交替最小化方法,在图结构未提供时联合学习用户图与偏好。
  • 推导出理论遗憾边界,其随时间呈次线性增长,依赖于图结构和问题参数。

实验结果

研究问题

  • RQ1是否可以在不依赖限制性聚类假设的前提下,将GOB模型扩展至大规模图?
  • RQ2能否利用基于GMRF的推理与采样技术,实现在GOB框架中高效执行汤普森采样?
  • RQ3所提出的基于GMRF的GOB方法在遗憾和可扩展性方面,与忽略图结构和基于聚类的基线方法相比表现如何?
  • RQ4在缺乏先验图信息的情况下,联合学习用户偏好与社交图结构的框架是否有效?
  • RQ5可为所提出的基于GMRF的汤普森采样算法建立怎样的理论遗憾边界?

主要发现

  • 所提出的基于GMRF的GOB方法实现了次线性遗憾,其规模与用户数量的平方根及图的有效维度相关,展现出强大的理论保证。
  • 由于使用了稀疏GMRF求解器,该方法在大规模图上表现出高效的可扩展性,避免了原始GOB模型的二次时间复杂度。
  • 实证结果表明,该方法在累积遗憾方面优于或至少匹配忽略图结构和基于聚类的方法。
  • 采用基于扰动的汤普森采样变体实现了可扩展的后验采样,使其适用于大规模老虎机问题。
  • 在用户图未预先提供的情况下,联合图与偏好学习的启发式方法表现出有前景的性能。
  • 理论分析确认,遗憾依赖于逆拉普拉斯矩阵的迹和问题特定参数,反映出图结构对学习效率的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。