Skip to main content
QUICK REVIEW

[论文解读] Embedded Collaborative Filtering for "Cold Start" Prediction

Yubo Zhou, Ali Nadaf|arXiv (Cornell University)|Apr 9, 2017
Recommender Systems and Techniques参考文献 9被引用 3
一句话总结

本文提出嵌入式协同过滤(ECF),一种混合方法,利用Word2Vec(特别是Skip-gram和CBOW)对隐式用户-物品交互数据进行降维,以提升在‘冷启动’场景下的推荐性能。通过从短期用户会话中学习物品的密集分布式表示,ECF在用户交互历史极少时,于top-1和top-5推荐的精确率上优于传统协同过滤和最先进方法。

ABSTRACT

Using only implicit data, many recommender systems fail in general to provide a precise set of recommendations to users with limited interaction history. This issue is regarded as the "Cold Start" problem and is typically resolved by switching to content-based approaches where extra costly information is required. In this paper, we use a dimensionality reduction algorithm, Word2Vec (W2V), originally applied in Natural Language Processing problems under the framework of Collaborative Filtering (CF) to tackle the "Cold Start" problem using only implicit data. This combined method is named Embedded Collaborative Filtering (ECF). An experiment is conducted to determine the performance of ECF on two different implicit data sets. We show that the ECF approach outperforms other popular and state-of-the-art approaches in "Cold Start" scenarios.

研究动机与目标

  • 为解决推荐系统中用户交互历史极少的‘冷启动’问题。
  • 仅使用隐式反馈数据,无需用户或物品元数据等辅助信息,提升推荐准确性。
  • 开发一种在协同过滤框架内利用分布式表示学习(Word2Vec)的方法,从稀疏交互中建模用户偏好。
  • 在‘冷启动’与非‘冷启动’场景下,将所提方法与最先进方法进行对比评估。

提出的方法

  • 该方法将Word2Vec(Skip-gram与CBOW)应用于用户交互序列,学习物品的低维密集嵌入表示,将每个用户会话视为物品的‘句子’。
  • 通过负采样和随机梯度下降学习物品嵌入,以最大化用户会话中共同出现物品的可能性。
  • 利用学习到的物品嵌入通过余弦相似度计算物品-物品相似度,从而实现协同过滤推荐。
  • 通过加权平均结合短期(窗口大小5)与长期(窗口大小20)模型,构建混合模型以提升鲁棒性。
  • 通过基于嵌入物品向量相似度得分识别k个最近邻物品生成推荐。
  • 在两种公开数据集上,通过不同数据稀疏度水平下的precision@1和precision@5指标评估该方法。

实验结果

研究问题

  • RQ1基于Word2Vec的物品嵌入能否在仅有隐式反馈的‘冷启动’场景中提升协同过滤性能?
  • RQ2在高数据稀疏度下,ECF与传统Item-Item KNN及其他最先进方法的性能相比如何?
  • RQ3结合短期与长期用户会话模型是否能比单模型方法带来更高的推荐准确率?
  • RQ4在基于隐式反馈的推荐中,哪种Word2Vec变体——Skip-gram或CBOW——表现更优?
  • RQ5用户会话中隐藏(未见)物品的比例如何影响ECF与基线方法的精确率?

主要发现

  • ECF在‘冷启动’场景下,于precision@1和precision@5上均优于传统Item-Item KNN及其他最先进方法,尤其在90%或95%物品被隐藏时表现更优。
  • 在MovieLens 100k数据集上,ECF采用Skip-gram在90%隐藏率下达到precision@1为0.436,优于CF(0.316)和CDAE(0.379)。
  • 结合短期与长期用户会话嵌入的混合模型达到最高精确率,表明多尺度建模可提升鲁棒性。
  • 在两个数据集及所有隐藏率下,Skip-gram始终优于CBOW,表明其在序列物品模式表示学习方面更具优势。
  • 精确率随隐藏物品比例提高而上升,表明ECF在用户交互历史极短时尤为有效。
  • 在非‘冷启动’场景下,传统CF与CDAE方法优于ECF,证实ECF的优势在低数据环境下最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。