Skip to main content
QUICK REVIEW

[论文解读] Selective Transfer Learning for Cross Domain Recommendation

Zhongqi Lu, Erheng Zhong|arXiv (Cornell University)|Oct 26, 2012
Recommender Systems and Techniques被引用 6
一句话总结

该论文提出STLCF,一种用于跨域协同过滤的选择性迁移学习框架,通过识别并仅迁移源域中一致的知识来提高评分预测的准确性。通过在提升框架中结合经验预测误差及其方差以指导实例选择,STLCF减少了过拟合,并在极端数据稀疏性条件下优于最先进方法。

ABSTRACT

Collaborative filtering (CF) aims to predict users' ratings on items according to historical user-item preference data. In many real-world applications, preference data are usually sparse, which would make models overfit and fail to give accurate predictions. Recently, several research works show that by transferring knowledge from some manually selected source domains, the data sparseness problem could be mitigated. However for most cases, parts of source domain data are not consistent with the observations in the target domain, which may misguide the target domain model building. In this paper, we propose a novel criterion based on empirical prediction error and its variance to better capture the consistency across domains in CF settings. Consequently, we embed this criterion into a boosting framework to perform selective knowledge transfer. Comparing to several state-of-the-art methods, we show that our proposed selective transfer learning framework can significantly improve the accuracy of rating prediction tasks on several real-world recommendation tasks.

研究动机与目标

  • 通过利用相关源域的知识来解决协同过滤中的数据稀疏性挑战。
  • 克服现有迁移学习方法假设所有源数据均与目标域一致的局限性。
  • 提出一种衡量源域与目标域之间一致性的准则,超越仅基于经验误差的判断。
  • 设计一种选择性迁移学习框架,自适应地加权并仅选择可靠源实例用于模型训练。
  • 通过基于方差的实例选择,提升对长尾用户和稀疏目标域的鲁棒性与性能。

提出的方法

  • 提出一种新颖的一致性准则,结合经验预测误差及其方差,以评估源域数据用于迁移的可靠性。
  • 将一致性准则整合进提升框架中,基于误差和方差迭代地重新加权源实例。
  • 在STLCF框架内使用高斯过程潜在语义分析(GPLSA)作为基础模型,以处理稀疏的用户-物品交互。
  • 在提升过程中应用迭代重新加权,优先选择误差低且方差低的源实例——表明其偏好稳定且一致。
  • 通过过滤掉不一致或噪声较大的源数据,实现选择性知识迁移,避免误导目标模型。
  • 将框架泛化以支持多种基础模型,展示了其在GPLSA和TGPLSA上的有效性。

实验结果

研究问题

  • RQ1我们如何有效识别哪些源域实例与目标域一致,以避免传递误导性知识?
  • RQ2将经验误差的方差纳入考虑,在协同过滤中在多大程度上提升了知识迁移的可靠性?
  • RQ3基于方差感知实例选择的提升框架是否能在稀疏推荐场景中优于非选择性迁移学习?
  • RQ4所提出方法在长尾用户上的表现如何,这些用户尤其容易受到数据稀疏性的影响?
  • RQ5当目标域数据密度极低时,该框架是否仍能保持对过拟合的鲁棒性?

主要发现

  • STLCF在多个真实世界数据集上相比最先进方法显著提升了评分预测准确性。
  • STLCF的测试RMSE随着潜在主题数增加而持续降低(最高至k=125),而GPLSA和TGPLSA在k>50和k>75后开始过拟合,RMSE开始上升。
  • STLCF在极稀疏目标域(如0.3%稀疏度)中表现出更强的抗过拟合能力,保持了较低的泛化误差。
  • 在一致性准则中引入方差,能够更准确地识别出可靠的源实例,尤其适用于跨域偏好一致的用户。
  • STLCF在长尾用户上表现尤为出色,这些用户通常难以被非选择性迁移方法有效服务。
  • 该框架具有良好的泛化能力,可与多种基础模型结合,包括GPLSA和TGPLSA,并持续提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。