Skip to main content
QUICK REVIEW

[论文解读] Rethinking Neural vs. Matrix-Factorization Collaborative Filtering: the Theoretical Perspectives

Da Xu, Chuanwei Ruan|arXiv (Cornell University)|Oct 23, 2021
Domain Adaptation and Few-Shot Learning参考文献 54被引用 4
一句话总结

本文对神经协同过滤(NCF)和矩阵分解协同过滤(MCF)进行了严格的理论分析,表明在梯度下降优化下,两种模型均收敛至类似的范数约束最大间隔解。研究揭示,在归纳设置下,MCF的泛化能力更强,而NCF在归纳设置中受曝光偏差影响,提出了一种新颖的泛化界,可考虑缺失非随机(MNAR)数据分布的影响。

ABSTRACT

The recent work by Rendle et al. (2020), based on empirical observations, argues that matrix-factorization collaborative filtering (MCF) compares favorably to neural collaborative filtering (NCF), and conjectures the dot product's superiority over the feed-forward neural network as similarity function. In this paper, we address the comparison rigorously by answering the following questions: 1. what is the limiting expressivity of each model; 2. under the practical gradient descent, to which solution does each optimization path converge; 3. how would the models generalize under the inductive and transductive learning setting. Our results highlight the similar expressivity for the overparameterized NCF and MCF as kernelized predictors, and reveal the relation between their optimization paths. We further show their different generalization behaviors, where MCF and NCF experience specific tradeoff and comparison in the transductive and inductive collaborative filtering setting. Lastly, by showing a novel generalization result, we reveal the critical role of correcting exposure bias for model evaluation in the inductive setting. Our results explain some of the previously observed conflicts, and we provide synthetic and real-data experiments to shed further insights to this topic.

研究动机与目标

  • 为解决关于神经协同过滤(NCF)是否优于矩阵分解协同过滤(MCF)的长期争议,提供严谨的理论基础。
  • 研究在过参数化设置下,NCF和MCF作为核化预测器的极限表达能力。
  • 分析梯度下降优化路径在两种模型中的归纳偏差,并确定其收敛行为。
  • 在归纳与归纳学习设置下比较泛化性能,特别是在数据缺失非随机(MNAR)条件下的表现。
  • 推导一种新颖的泛化界,以考虑归纳协同过滤中的曝光偏差,提升模型评估的可靠性。

提出的方法

  • 利用神经正切核(NTK)框架,分析NCF和MCF作为核化预测器的极限表达能力。
  • 推导统一的优化分析,表明在梯度下降下,NCF和MCF均收敛至范数约束的最大间隔解。
  • 提出一种可证明紧致的范数约束容量分析,用于比较在归纳与归纳设置下的泛化行为。
  • 提出一种逆倾向加权(IPW)校正机制,以考虑归纳学习中的曝光偏差,提升泛化评估性能。
  • 通过合成数据和真实世界数据实验验证理论发现,包括在有偏与无偏评估指标下的AUC比较。
  • 使用凸优化(CVXOPT)计算精确的核范数最大间隔解,用于与MCF和NCF预测结果进行对比。

实验结果

研究问题

  • RQ1在过参数化设置下,NCF和MCF作为核化预测器的极限表达能力是什么?
  • RQ2在梯度下降优化下,NCF和MCF收敛至何种解?其优化路径如何比较?
  • RQ3在归纳与归纳学习设置下,NCF和MCF的泛化性能如何?
  • RQ4曝光偏差在模型评估中起什么作用?如何通过校正提升归纳设置下的泛化评估?
  • RQ5经验分布与曝光分布之间的差异如何影响模型泛化?是否可理论界?

主要发现

  • 在梯度下降下,NCF和MCF均收敛至范数约束的最大间隔解,表明尽管架构不同,但二者具有相同的归纳偏差。
  • 当作为核化预测器看待时,过参数化设置下的NCF和MCF表达能力等价,二者在无限宽度极限下建模相同的函数类。
  • 在归纳设置下,MCF由于对数据分布偏移具有内在不变性,泛化能力优于NCF,而NCF因曝光偏差表现较差。
  • 在归纳设置下,若未校正曝光偏差,NCF泛化性能差,但通过逆倾向加权(IPW)校正后性能显著提升。
  • 推导出一种新颖的泛化界,可考虑缺失非随机(MNAR)机制的影响,表明曝光偏差校正是可靠评估的关键。
  • 实验结果证实,采用IPW的NCF在AUC性能上达到无偏水平,与MCF相当,解决了以往模型比较中的经验矛盾。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。