Skip to main content
QUICK REVIEW

[论文解读] Improving Collaborative Filtering based Recommenders using Topic Modelling

Jobin Wilson, Santanu Chaudhury|arXiv (Cornell University)|Feb 25, 2014
Recommender Systems and Techniques参考文献 4被引用 9
一句话总结

本文提出一种混合推荐方法,通过引入潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)对项目文本描述和用户主题偏好进行建模,以增强协同过滤(Collaborative Filtering, CF)。通过在统一度量中结合基于评分的相似性与基于主题的相似性,该方法减少了数据稀疏性并提升了准确性,在多个公开数据集上的精确率、召回率和F1值指标上均优于标准的基于用户的和基于项目的CF方法。

ABSTRACT

Standard Collaborative Filtering (CF) algorithms make use of interactions between users and items in the form of implicit or explicit ratings alone for generating recommendations. Similarity among users or items is calculated purely based on rating overlap in this case,without considering explicit properties of users or items involved, limiting their applicability in domains with very sparse rating spaces. In many domains such as movies, news or electronic commerce recommenders, considerable contextual data in text form describing item properties is available along with the rating data, which could be utilized to improve recommendation quality.In this paper, we propose a novel approach to improve standard CF based recommenders by utilizing latent Dirichlet allocation (LDA) to learn latent properties of items, expressed in terms of topic proportions, derived from their textual description. We infer user's topic preferences or persona in the same latent space,based on her historical ratings. While computing similarity between users, we make use of a combined similarity measure involving rating overlap as well as similarity in the latent topic space. This approach alleviates sparsity problem as it allows calculation of similarity between users even if they have not rated any items in common. Our experiments on multiple public datasets indicate that the proposed hybrid approach significantly outperforms standard user Based and item Based CF recommenders in terms of classification accuracy metrics such as precision, recall and f-measure.

研究动机与目标

  • 为解决协同过滤(CF)推荐系统中用户-项目评分稀疏性问题,特别是在用户-项目评分数据有限的领域。
  • 利用项目文本描述(如电影剧情或产品评论)来丰富用户和项目表征,超越评分数据本身。
  • 通过LDA从项目文本中提取的潜在主题空间,对用户偏好进行建模,实现即使在无共同评分的情况下也能计算相似性。
  • 设计一种混合相似度度量方法,结合评分重叠与基于主题的相似性,以改进用户-用户和项目-项目之间的相似度估计。
  • 通过实证验证,所提方法在真实世界数据集上的分类指标表现优于标准CF方法。

提出的方法

  • 对项目文本描述应用潜在狄利克雷分配(LDA),提取主题分布,为每个项目生成潜在主题表征。
  • 通过将用户历史评分建模为同一主题空间中的分布,推断用户在主题空间中的偏好,利用LDA生成的项目主题。
  • 通过加权结合评分重叠与潜在主题空间中的余弦相似度,计算用户之间的综合相似度度量。
  • 在基于用户的和基于项目的协同过滤框架中使用该混合相似度度量生成推荐结果。
  • 在评分矩阵稀疏的公开数据集上训练并评估模型,与标准CF基线方法进行性能比较。
  • 通过交叉验证调优评分与主题相似度的融合权重,优化两者的加权组合。

实验结果

研究问题

  • RQ1将项目文本中的潜在主题融入协同过滤推荐系统,是否能提升在稀疏评分环境下的性能?
  • RQ2当用户之间无共同评分项目时,结合基于评分的相似性与基于主题的相似性,能在多大程度上改善用户相似度估计?
  • RQ3所提出的混合模型在精确率、召回率和F1值方面,与标准的基于用户和基于项目的CF相比表现如何?
  • RQ4在从项目文本中提取的主题空间中建模用户偏好,是否能带来更准确且更鲁棒的推荐结果?
  • RQ5在综合相似度度量中,评分重叠与主题相似度的最优平衡点是什么?

主要发现

  • 所提出的混合方法在多个公开数据集上,于精确率、召回率和F1值指标上均显著优于标准的基于用户和基于项目的协同过滤方法。
  • 该方法通过基于主题的相似性,有效缓解了稀疏性问题,即使用户之间无任何共同评分,也能实现用户间相似度计算。
  • 通过项目描述中的主题建模,提升了推荐准确性,能够捕捉评分之外的语义与上下文信息。
  • 在评分与主题相似度的融合达到平衡时性能最佳,证明了结合显式评分与潜在语义特征的价值。
  • 该模型在不同数据集上均表现出一致的性能提升,表明其对不同稀疏程度和领域特性的数据具有鲁棒性。
  • 利用LDA在共享潜在空间中对项目和用户偏好进行建模,实现了有意义的表征学习,且无需额外的用户或项目元数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。