Skip to main content
QUICK REVIEW

[论文解读] Ordinal Non-negative Matrix Factorization for Recommendation

Olivier Gouvert, Thomas Oberlin|arXiv (Cornell University)|Jun 1, 2020
Recommender Systems and Techniques参考文献 31被引用 8
一句话总结

本文提出 OrdNMF,一种用于推荐系统中序数数据的新型非负矩阵分解方法,可在不进行二值化的情况下对评分或量化交互行为进行建模。通过使用具有逆伽马噪声的阈值化潜在变量模型,OrdNMF 比二值化的 PF 或 BePoF 方法保留了更丰富的数据结构,在显式和隐式数据集上均实现了更优的推荐性能和更佳的后验预测拟合。

ABSTRACT

We introduce a new non-negative matrix factorization (NMF) method for ordinal data, called OrdNMF. Ordinal data are categorical data which exhibit a natural ordering between the categories. In particular, they can be found in recommender systems, either with explicit data (such as ratings) or implicit data (such as quantized play counts). OrdNMF is a probabilistic latent factor model that generalizes Bernoulli-Poisson factorization (BePoF) and Poisson factorization (PF) applied to binarized data. Contrary to these methods, OrdNMF circumvents binarization and can exploit a more informative representation of the data. We design an efficient variational algorithm based on a suitable model augmentation and related to variational PF. In particular, our algorithm preserves the scalability of PF and can be applied to huge sparse datasets. We report recommendation experiments on explicit and implicit datasets, and show that OrdNMF outperforms BePoF and PF applied to binarized data.

研究动机与目标

  • 解决传统协同过滤方法在对用户-物品交互行为进行二值化时导致的信息损失问题。
  • 为常见于显式评分和隐式播放次数的序数数据开发一种生成式概率模型,同时保留序数结构。
  • 在建模更丰富、非二值化的序数数据的同时,保持泊松因子分解的可扩展性,通过阈值化潜在变量框架实现。
  • 通过利用序数类别的自然顺序而非将其视为名义变量或连续变量,提升推荐准确率。
  • 通过使用带有模型增强的变分算法,在大规模稀疏数据集上实现高效推理,同时保持计算效率。

提出的方法

  • 提出一种阈值模型,其中序数观测值是通过使用一系列阈值对连续潜在变量进行量化而得到的。
  • 使用非负矩阵分解(NMF)对潜在变量进行建模,并引入来自逆伽马(IG)分布的乘法噪声。
  • 采用模型增强技术,推导出用于估计潜在因子和阈值的高效变分推理算法。
  • 使用变分贝叶斯方法制定后验近似,对用户因子(W)、物品因子(H)和阈值(b)分别进行更新。
  • 将该算法应用于显式数据集(如 MovieLens)和隐式数据集(如 Taste Profile),以量化计数作为序数输入。
  • 通过设计仅依赖于非零观测数量而非完整矩阵大小的算法,确保可扩展性。

实验结果

研究问题

  • RQ1非负矩阵分解模型是否能在不二值化原始交互行为的前提下,有效处理推荐系统中的序数数据?
  • RQ2与二值化方法或连续回归方法相比,使用阈值化潜在变量结构建模序数数据在预测性能方面表现如何?
  • RQ3与 BePoF 和 PF 等现有方法相比,保留序数结构在多大程度上能提升推荐准确率和后验预测拟合度?
  • RQ4所提出的变分推理算法是否能高效扩展至现实推荐系统中常见的大规模稀疏数据集?
  • RQ5该模型自适应推断阈值的能力是否能相比现有模型更优地建模隐式数据中的极端值(如高播放次数)?”

主要发现

  • 在 MovieLens 数据集上,OrdNMF 在不同 NDCG 阈值下均优于应用于二值化数据的 BePoF 和 PF,尤其在 s=1 到 s=10 的多种阈值下表现更优。
  • 在 MovieLens 数据集上,OrdNMF 在不同 NDCG 阈值(s=1 至 s=10)下保持了稳定的性能表现,而 BePoF 在极端阈值下表现较差。
  • 在 Taste Profile 数据集上,OrdNMF 的对数似然值高于 dcPF,表明其对数据分布的拟合更优,尤其在高值类别中表现更佳。
  • 后验预测检验显示,OrdNMF 准确地建模了从罕见高计数值(如 >50 次播放)到所有序数类别的完整范围,而 dcPF 未能捕捉这些值。
  • 该模型的后验预测分布在 MovieLens 和 Taste Profile 数据集上均与经验直方图高度吻合,证实其对数据分布偏移具有鲁棒性。
  • 变分推理算法在 5 次运行内可靠收敛,ELBO 提升稳定,相对增量低于 τ=10−5。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。