[论文解读] Factorization Machines for Data with Implicit Feedback
本文提出 FM-Pair,一种针对隐式反馈数据集优化的因子分解机(Factorization Machines)成对学习排序方法。通过用受 BPR 启发的成对损失替代标准的点对损失,FM-Pair 在保持线性复杂度和可扩展性的前提下,相较于标准 FMs 和 SOTA 方法(如 BPR-MF),显著提升了排序性能。
In this work, we propose FM-Pair, an adaptation of Factorization Machines with a pairwise loss function, making them effective for datasets with implicit feedback. The optimization model in FM-Pair is based on the BPR (Bayesian Personalized Ranking) criterion, which is a well-established pairwise optimization model. FM-Pair retains the advantages of FMs on generality, expressiveness and performance and yet it can be used for datasets with implicit feedback. We also propose how to apply FM-Pair effectively on two collaborative filtering problems, namely, context-aware recommendation and cross-domain collaborative filtering. By performing experiments on different datasets with explicit or implicit feedback we empirically show that in most of the tested datasets, FM-Pair beats state-of-the-art learning-to-rank methods such as BPR-MF (BPR with Matrix Factorization model). We also show that FM-Pair is significantly more effective for ranking, compared to the standard FMs model. Moreover, we show that FM-Pair can utilize context or cross-domain information effectively as the accuracy of recommendations would always improve with the right auxiliary features. Finally we show that FM-Pair has a linear time complexity and scales linearly by exploiting additional features.
研究动机与目标
- 解决标准因子分解机(FMs)在处理现实推荐系统中常见的隐式反馈数据时的局限性。
- 克服简单隐式到显式映射方法的不足,该方法因采用点对优化和不可靠的负采样而无法有效优化排序性能。
- 开发一种可扩展的通用模型,在保持 FMs 的表达能力与线性复杂度的同时,有效适用于隐式反馈的排序任务。
- 通过整合上下文特征(如时间、位置)和跨域物品特征等辅助特征,证明 FM-Pair 在上下文感知与跨域协同过滤中的有效性。
- 展示 FM-Pair 在因子分解维度和特征数量增加时的线性可扩展性,使其适用于大规模应用场景。
提出的方法
- 将因子分解机适配为使用受贝叶斯个性化排序(BPR)准则启发的成对排序损失函数,替代标准的点对回归损失。
- 制定优化目标,以最大化正样本(用户-物品交互)的预测得分相对于负样本(采样得到的)交互的得分,从而提升排序性能。
- 保留原始 FM 的结构,包括将用户、物品和辅助特征映射到共享潜在空间,以维持模型的通用性与表达能力。
- 通过将上下文(如时间、位置)和跨域物品特征映射到与用户和物品相同的潜在空间,实现对辅助特征的整合。
- 使用带成对排序目标的随机梯度下降进行模型训练,确保每个样本的时间复杂度为 O(k),其中 k 为非零特征的数量。
- 利用 WrapRec 工具包实现多数据集与多配置下的可复现评估,确保与基线方法(如 BPR-MF 和标准 FMs)的一致性比较。
实验结果
研究问题
- RQ1与标准点对训练相比,成对优化目标是否能提升因子分解机在隐式反馈数据集上的排序性能?
- RQ2在隐式反馈数据上,FM-Pair 与 SOTA 的排序学习方法(如 BPR-MF)相比,在准确率和可扩展性方面表现如何?
- RQ3FM-Pair 在协同过滤任务中,对上下文或跨域信息等辅助特征的有效利用程度如何?
- RQ4将隐式反馈简单映射为显式标签(如点击记为 +1,无交互记为 0)是否会导致 FMs 的排序性能次优?
- RQ5FM-Pair 在因子分解维度和辅助特征数量增加时的可扩展性如何?其是否保持线性时间复杂度?
主要发现
- FM-Pair 在排序任务中显著优于标准因子分解机,即使在显式反馈数据上进行训练,也因采用成对优化目标而表现更优。
- 在四个包含隐式反馈的真实世界数据集上,FM-Pair 的准确率高于 BPR-MF(当前隐式反馈排序的 SOTA 方法)。
- 该模型在潜在因子数量和辅助特征数量方面均表现出线性可扩展性,训练时间增长缓慢。
- 在如 Frappe 等流行度偏斜的数据集上,引入物品偏置显著提升了性能,表明在隐式反馈场景中建模偏置的重要性。
- FM-Pair 有效利用了辅助特征(如上下文和跨域物品特征),实现了稳定性能提升,且无需重新配置模型。
- 与标准 FMs 所用的点对损失相比,FM-Pair 的成对训练目标在负样本不可靠时仍能实现更好的收敛性和排序质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。