Skip to main content
QUICK REVIEW

[论文解读] Negative Binomial Matrix Factorization for Recommender Systems

Olivier Gouvert, Thomas Oberlin|arXiv (Cornell University)|Jan 5, 2018
Bayesian Methods and Mixture Models参考文献 28被引用 5
一句话总结

本文提出负二项分布矩阵分解(NBMF),一种概率矩阵分解模型,通过引入潜在曝光变量,将泊松因子分解(PF)扩展以建模计数数据中的过度离散现象。通过将用户-物品交互建模为负二项分布,NBMF 避免了二值化带来的信息损失,并在 Taste Profile 数据集上实现了比标准 PF 和二值化 PF 更优的推荐准确率,多个指标均表现更优。

ABSTRACT

We introduce negative binomial matrix factorization (NBMF), a matrix factorization technique specially designed for analyzing over-dispersed count data. It can be viewed as an extension of Poisson matrix factorization (PF) perturbed by a multiplicative term which models exposure. This term brings a degree of freedom for controlling the dispersion, making NBMF more robust to outliers. We show that NBMF allows to skip traditional pre-processing stages, such as binarization, which lead to loss of information. Two estimation approaches are presented: maximum likelihood and variational Bayes inference. We test our model with a recommendation task and show its ability to predict user tastes with better precision than PF.

研究动机与目标

  • 为解决泊松因子分解(PF)在处理隐式推荐系统中常见的过度离散、稀疏且突发性的计数数据时的局限性。
  • 消除预处理步骤(如二值化)的需要,这些步骤会丢弃宝贵的交互计数信息。
  • 提出一种灵活的矩阵分解模型,通过潜在曝光变量捕捉局部可变性。
  • 证明 NBMF 在真实世界的隐式反馈数据上,相较于 PF 能提供更准确且更鲁棒的推荐。

提出的方法

  • NBMF 将用户-物品交互 $ y_{ui} $ 建模为负二项分布,其均值为 $ [\mathbf{W}\mathbf{H}^T]_{ui} $,离散参数为 $ \alpha $,允许方差超过均值。
  • 该模型被表述为层次化的泊松-伽马混合模型:$ a_{ui} \sim \mathcal{G}(\alpha, \alpha) $,$ y_{ui} \mid a_{ui} \sim \text{Pois}(a_{ui} [\mathbf{W}\mathbf{H}^T]_{ui}) $,其中 $ \mathbf{A} $ 用于捕捉局部曝光效应。
  • 采用两种估计方法:最大似然估计和变分贝叶斯推断以近似后验分布。
  • 曝光变量 $ a_{ui} $ 被解释为用户对某物品的曝光程度,值 $ <1 $ 表示曝光不足,值 $ >1 $ 表示过度消费。
  • 模型在未经二值化的原始计数数据上进行训练,保留了交互频率信息。
  • 推荐基于期望值 $ [\mathbf{W}\mathbf{H}^T]_{ui} $ 生成,曝光值用于指导项目优先级排序。

实验结果

研究问题

  • RQ1一种能考虑用户-物品交互计数中过度离散现象的矩阵分解模型,是否能提升推荐准确率?
  • RQ2将曝光建模为连续潜在变量,是否优于对交互计数进行二值化处理?
  • RQ3包含离散参数 $ \alpha $ 是否能增强模型在隐式反馈数据中对噪声和异常值的鲁棒性?
  • RQ4潜在曝光变量 $ \mathbf{A} $ 是否能提供关于用户行为(如低消费或过度消费)的可解释洞察?
  • RQ5在真实世界的基于计数的推荐任务中,NBMF 是否在 NDCG 等排序指标上优于泊松因子分解?

主要发现

  • 在原始计数数据上,NBMF 显著优于标准泊松因子分解(PF),在 NDCG 指标上表现更优,且无需任何预处理即可实现更高精度。
  • NBMF 的性能优于二值化 PF,尤其在使用更高阈值 $ s > 1 $ 时表现更优,表明其对低计数噪声交互具有更强的鲁棒性。
  • NBMF 的最优潜在因子数 $ K $ 为 50,而二值化 PF 为 20,表明 NBMF 更好地利用了计数值中的丰富信息。
  • 潜在曝光变量 $ \mathbf{A} $ 提供了可解释的洞察:高计数但低 $ a_{ui} $ 的项目表示被过度消费,而低计数但高 $ a_{ui} $ 的项目表示曝光不足。
  • 在探索性分析中,NBMF 能成功推荐同类型流派的项目(例如,向喜欢 The Black Keys 的用户推荐 The Ramones),表明其推荐结果具有一致性和上下文相关性。
  • 结果表明,通过潜在曝光变量建模离散性,相比泊松模型中假设固定方差,能实现更准确且更鲁棒的推荐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。