Skip to main content
QUICK REVIEW

[论文解读] Collaborative Filtering vs. Content-Based Filtering: differences and similarities

Rafael Glauber, Ângelo Loula|arXiv (Cornell University)|Dec 18, 2019
Recommender Systems and Techniques参考文献 25被引用 4
一句话总结

本文提出了一套全面的离线评估框架,用于在传统精确率指标之外,比较协同过滤(CF)与基于内容的(CB)推荐系统。基于两个数据集——带IMDb扩展的MovieLens和CiteULike——评估了一个基线CF算法及两种自定义的记忆型CB算法,结果表明CB与CF在推荐结果上存在显著差异且具有互补性,尤其在小列表中表现突出,CB在使用相关项目属性(如演员)时,表现出更优的目录覆盖度与多样性。

ABSTRACT

Recommendation Systems (SR) suggest items exploring user preferences, helping them with the information overload problem. Two approaches to SR have received more prominence, Collaborative Filtering, and Content-Based Filtering. Moreover, even though studies are indicating their advantages and disadvantages, few results empirically prove their characteristics, similarities, and differences. In this work, an experimental methodology is proposed to perform comparisons between recommendation algorithms for different approaches going beyond the "precision of the predictions". For the experiments, three algorithms of recommendation were tested: a baseline for Collaborative Filtration and two algorithms for Content-based Filtering that were developed for this evaluation. The experiments demonstrate the behavior of these systems in different data sets, its main characteristics and especially the complementary aspect of the two main approaches.

研究动机与目标

  • 开发一种系统化的离线评估方法,超越标准精确率指标,以比较协同过滤与基于内容的过滤方法。
  • 通过实证方法评估CF与CB系统在不同数据集上的推荐行为差异与相似性。
  • 评估不同项目内容属性(如演员、类型、导演)对CB推荐性能的影响。
  • 研究CF与CB推荐的互补性,特别是在Top-N列表中的重叠与多样性方面。
  • 通过识别CF与CB有效结合的时机与方式,为混合推荐系统提供基础。

提出的方法

  • 本研究使用两个不同的数据集:带IMDb元数据扩展的MovieLens 1M,以及CiteULike,分别代表不同的推荐场景。
  • 实现了一个基于用户的协同过滤(CF)基线算法,采用基于相似度的预测方法。
  • 开发了两种自定义的记忆型基于内容的(CB)算法:一种使用单个项目属性(如演员、类型),另一种使用拼接的属性集合(演员 + 编剧 + 导演)。
  • 评估协议包括标准指标(如MAP、覆盖度)以及引入的新指标,聚焦于推荐列表之间的交集与相似性。
  • 通过Jaccard相似度与真正例交集,比较推荐列表,以评估重叠度与多样性。
  • 在不同列表大小(如10、20、50)下进行实验,以分析不同过滤条件下的行为表现。

实验结果

研究问题

  • RQ1在不同数据集中,协同过滤与基于内容的过滤在推荐输出上存在哪些差异?
  • RQ2CF与CB推荐在多大程度上重叠或偏离,特别是在小推荐列表中?
  • RQ3在MovieLens数据集中,哪些项目属性对基于内容的推荐具有最显著的贡献?
  • RQ4基于内容的过滤性能如何随可用项目内容的数量与类型而变化?
  • RQ5能否定量证明CF与CB的互补性?这又如何指导混合系统的设计?

主要发现

  • 在MovieLens数据集中,基于内容的算法(SUP)生成的推荐与协同过滤的推荐存在显著差异,尤其在较小的推荐列表(如Top-10)中,随着列表长度增加,重叠度才逐渐上升。
  • SUP算法实现了较高的目录覆盖度,并表明基于内容的过滤可有效利用相关属性(如演员)推荐‘优质项目’,其中演员属性表现出强大的预测能力。
  • 性别与类型等属性表现较差,表明并非所有项目特征对基于内容的过滤都同样有效,尤其当特征过于粗粒度或过于普遍时。
  • 在CiteULike数据集中,由于用户协作度低且用户-项目交互稀疏,协同过滤表现欠佳,凸显了其在低协作环境中的局限性。
  • 交集分析表明,CF与CB系统推荐的项目大多不重叠,证实了其互补性,支持混合系统集成。
  • MAP结果表明,拼接属性集合(演员 + 编剧 + 导演)优于单一属性,表明结合多个特征可提升CB推荐质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。