[论文解读] Negative Binomial Matrix Factorization for Recommender Systems
本文提出负二项分布矩阵分解(NBMF),一种概率矩阵分解模型,通过引入潜在曝光变量,将泊松因子分解(PF)扩展以建模计数数据中的过度离散现象。通过将用户-物品交互建模为负二项分布,NBMF 避免了二值化带来的信息损失,并在 Taste Profile 数据集上实现了比标准 PF 和二值化 PF 更优的推荐准确率,多个指标均表现更优。
We introduce negative binomial matrix factorization (NBMF), a matrix factorization technique specially designed for analyzing over-dispersed count data. It can be viewed as an extension of Poisson matrix factorization (PF) perturbed by a multiplicative term which models exposure. This term brings a degree of freedom for controlling the dispersion, making NBMF more robust to outliers. We show that NBMF allows to skip traditional pre-processing stages, such as binarization, which lead to loss of information. Two estimation approaches are presented: maximum likelihood and variational Bayes inference. We test our model with a recommendation task and show its ability to predict user tastes with better precision than PF.
研究动机与目标
- 为解决泊松因子分解(PF)在处理隐式推荐系统中常见的过度离散、稀疏且突发性的计数数据时的局限性。
- 消除预处理步骤(如二值化)的需要,这些步骤会丢弃宝贵的交互计数信息。
- 提出一种灵活的矩阵分解模型,通过潜在曝光变量捕捉局部可变性。
- 证明 NBMF 在真实世界的隐式反馈数据上,相较于 PF 能提供更准确且更鲁棒的推荐。
提出的方法
- NBMF 将用户-物品交互 $ y_{ui} $ 建模为负二项分布,其均值为 $ [\mathbf{W}\mathbf{H}^T]_{ui} $,离散参数为 $ \alpha $,允许方差超过均值。
- 该模型被表述为层次化的泊松-伽马混合模型:$ a_{ui} \sim \mathcal{G}(\alpha, \alpha) $,$ y_{ui} \mid a_{ui} \sim \text{Pois}(a_{ui} [\mathbf{W}\mathbf{H}^T]_{ui}) $,其中 $ \mathbf{A} $ 用于捕捉局部曝光效应。
- 采用两种估计方法:最大似然估计和变分贝叶斯推断以近似后验分布。
- 曝光变量 $ a_{ui} $ 被解释为用户对某物品的曝光程度,值 $ <1 $ 表示曝光不足,值 $ >1 $ 表示过度消费。
- 模型在未经二值化的原始计数数据上进行训练,保留了交互频率信息。
- 推荐基于期望值 $ [\mathbf{W}\mathbf{H}^T]_{ui} $ 生成,曝光值用于指导项目优先级排序。
实验结果
研究问题
- RQ1一种能考虑用户-物品交互计数中过度离散现象的矩阵分解模型,是否能提升推荐准确率?
- RQ2将曝光建模为连续潜在变量,是否优于对交互计数进行二值化处理?
- RQ3包含离散参数 $ \alpha $ 是否能增强模型在隐式反馈数据中对噪声和异常值的鲁棒性?
- RQ4潜在曝光变量 $ \mathbf{A} $ 是否能提供关于用户行为(如低消费或过度消费)的可解释洞察?
- RQ5在真实世界的基于计数的推荐任务中,NBMF 是否在 NDCG 等排序指标上优于泊松因子分解?
主要发现
- 在原始计数数据上,NBMF 显著优于标准泊松因子分解(PF),在 NDCG 指标上表现更优,且无需任何预处理即可实现更高精度。
- NBMF 的性能优于二值化 PF,尤其在使用更高阈值 $ s > 1 $ 时表现更优,表明其对低计数噪声交互具有更强的鲁棒性。
- NBMF 的最优潜在因子数 $ K $ 为 50,而二值化 PF 为 20,表明 NBMF 更好地利用了计数值中的丰富信息。
- 潜在曝光变量 $ \mathbf{A} $ 提供了可解释的洞察:高计数但低 $ a_{ui} $ 的项目表示被过度消费,而低计数但高 $ a_{ui} $ 的项目表示曝光不足。
- 在探索性分析中,NBMF 能成功推荐同类型流派的项目(例如,向喜欢 The Black Keys 的用户推荐 The Ramones),表明其推荐结果具有一致性和上下文相关性。
- 结果表明,通过潜在曝光变量建模离散性,相比泊松模型中假设固定方差,能实现更准确且更鲁棒的推荐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。