Skip to main content
QUICK REVIEW

[论文解读] Bayesian nonparametric models for ranked data

François Caron, Yee Whye Teh|arXiv (Cornell University)|Nov 19, 2012
Bayesian Methods and Mixture Models参考文献 22被引用 12
一句话总结

该论文提出了一种基于伽马过程先验的贝叶斯非参数Plackett-Luce模型扩展,用于处理无限项目池中的排序数据,从而实现对潜在无界选择集的推断。该研究推导出一种可处理的Gibbs采样器用于后验模拟,并将该模型应用于动态排序数据(如《纽约时报》畅销书榜),成功捕捉了随时间变化的项目偏好及其不确定性量化。

ABSTRACT

We develop a Bayesian nonparametric extension of the popular Plackett-Luce choice model that can handle an infinite number of choice items. Our framework is based on the theory of random atomic measures, with the prior specified by a gamma process. We derive a posterior characterization and a simple and effective Gibbs sampler for posterior simulation. We develop a time-varying extension of our model, and apply it to the New York Times lists of weekly bestselling books.

研究动机与目标

  • 开发一种贝叶斯非参数模型,将有限Plackett-Luce选择模型扩展至处理无限多个潜在项目。
  • 通过完全随机测度(specifically a gamma process prior over atomic measures representing item ratings)形式化该模型。
  • 推导后验表征及计算高效的Gibbs采样器,用于静态与动态设置下的后验模拟。
  • 利用连续时间Dawson-Watanabe超级过程对随时间变化的排名进行建模,并将该框架应用于现实世界的畅销书数据。
  • 实现对项目权重的不确定性量化,并检测排名动态中的结构性变化,如畅销书的快速更替。

提出的方法

  • 使用随机原子测度 $ G = \sum_{k=1}^{\infty} w_k \delta_{X_k} $ 建模项目池及其吸引力评分,其中 $ w_k $ 为评分,$ X_k $ 为项目。
  • 将伽马过程 $ \Gamma(\alpha, \tau, H) $ 作为 $ G $ 的先验,确保归一化测度服从狄利克雷过程。
  • 通过引入辅助变量解耦归一化过程,推导出在观察到部分排序下 $ G $ 的后验分布。
  • 构建一种Gibbs采样器,通过共轭更新迭代更新项目权重、隐变量及未观测项目总权重。
  • 通过连续时间Dawson-Watanabe超级过程将模型扩展至时变数据,其转移核由离散时间模型导出。
  • 将模型应用于2008至2012年每周《纽约时报》畅销书榜单,将项目权重建模为随时间演化,使用时齐相关参数 $ \phi $。

实验结果

研究问题

  • RQ1如何将Plackett-Luce模型扩展以处理排序数据中潜在的无限多个项目?
  • RQ2在非参数先验(如伽马过程)下,项目评分的后验分布是什么?
  • RQ3能否为该无限维设置下的后验推断推导出一种可处理的MCMC算法?
  • RQ4如何将该模型调整以捕捉畅销书榜单等场景中排名的时变动态?
  • RQ5该模型在多大程度上能捕捉如畅销书快速更替等结构性特征?如何根据出版时间进行调整?

主要发现

  • 该模型成功估计了所有出现在前20名榜单中的书籍的归一化权重,包括未观测书籍的总权重,如图3中的黑线所示。
  • 对于平装非虚构类(PN)类别,估计的相关参数 $ \phi $ 为 $ 85 \pm 20 $,表明其时间依赖性较慢,相较于平装小说类。
  • 对于平装小说类(HF)类别,$ \phi = 140 \pm 40 $,反映出更快的动力学特征和更高的排名更替率。
  • 形状参数 $ \alpha $ 在PN类别中估计为 $ 7 \pm 1.5 $,在HF类别中为 $ 2 \pm 1 $,表明PN类别中未观测项目具有更重尾的先验分布。
  • 该模型提供了对项目权重的不确定性量化,即使对于出现频率较低的书籍也能实现可靠的排名推断。
  • 由于模型具有连续样本路径,其在捕捉畅销书排名的急剧初始飙升方面能力有限,作者通过排除出版日前的书籍来解决此问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。