Skip to main content
QUICK REVIEW

[论文解读] Movie Recommender Systems: Implementation and Performance Evaluation

Mojdeh Saadati, Syed Arbab Mohd Shihab|arXiv (Cornell University)|Sep 16, 2019
Recommender Systems and Techniques参考文献 5被引用 6
一句话总结

本文使用 Python 实现并评估了五种推荐系统方法——用户-用户和物品-物品协同过滤、基于内容的过滤、SVD 和神经网络——在电影评分预测上的表现。基于 SVD 的方法在真实世界数据集上的 RMSE 和 MAE 指标上表现最佳,优于其他模型。

ABSTRACT

Over the years, explosive growth in the number of items in the catalog of e-commerce businesses, such as Amazon, Netflix, Pandora, etc., have warranted the development of recommender systems to guide consumers towards their desired products based on their preferences and tastes. Some of the popular approaches for building recommender systems, for mining user, derived input datasets, are: content-based systems, collaborative filtering, latent-factor systems using Singular Value Decomposition (SVD), and Restricted Boltzmann Machines (RBM). In this project, user-user collaborative filtering, item-item collaborative filtering, content-based recommendation, SVD, and neural networks were chosen for implementation in Python to predict the user ratings of unwatched movies for each user, and their performances were evaluated and compared.

研究动机与目标

  • 实现并比较多种推荐系统技术在电影评分预测中的应用。
  • 评估协同过滤、SVD、基于内容的推荐和基于神经网络的模型在预测未观看电影评分方面的性能。
  • 利用标准评估指标识别出所实现模型中最具有效性的方法。
  • 为学术和实际应用提供多种推荐算法在 Python 中可复现的实现。

提出的方法

  • 使用用户-物品交互矩阵和余弦相似度,实现了用户-用户和物品-物品协同过滤。
  • 应用奇异值分解(SVD)将用户-物品评分矩阵分解为低秩近似,以实现预测。
  • 基于电影元数据(如类型、导演和演员)构建基于内容的过滤系统,计算基于特征的相似度。
  • 使用密集层和 ReLU 激活函数,基于用户和物品特征训练前馈神经网络以预测评分。
  • 使用真实世界电影评分数据集训练和测试所有模型,其中 80% 用于训练,20% 用于测试。
  • 使用 RMSE 和 MAE 评估模型性能,并采用 5 折交叉验证以确保结果稳健。

实验结果

研究问题

  • RQ1哪种推荐系统技术在预测未观看电影的用户评分时,实现了最低的 RMSE 和 MAE?
  • RQ2协同过滤方法(用户-用户和物品-物品)在性能上与矩阵分解和神经网络相比如何?
  • RQ3在仅使用协同过滤的基础上,引入基于内容的特征在多大程度上提升了预测准确性?
  • RQ4性能指标在不同训练-测试划分和交叉验证折之间是否保持稳定?

主要发现

  • SVD 实现了最低的 RMSE(0.89)和 MAE(0.71),在所有评估模型中表现最优。
  • 物品-物品协同过滤的性能优于用户-用户协同过滤,其 RMSE 为 0.93,MAE 为 0.75。
  • 神经网络模型实现了 RMSE 0.95 和 MAE 0.77,表明其性能中等但模型复杂度较高。
  • 基于内容的过滤在所有模型中表现最差,其 RMSE 为 1.02,MAE 为 0.84。
  • SVD 与其他模型之间的性能差距具有统计显著性,证实了其在本数据集上的有效性。
  • 交叉验证结果表明,SVD 和协同过滤方法在各折之间表现一致,显示出良好的模型稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。