Skip to main content
QUICK REVIEW

[论文解读] Comprehensive Movie Recommendation System

Hrisav Bhowmick, Ananda Chatterjee|arXiv (Cornell University)|Dec 23, 2021
Image and Video Quality Assessment被引用 10
一句话总结

本文提出了一套全面的电影推荐系统,整合了基于内容的过滤(TF-IDF、SVD)、协同过滤(皮尔逊相关系数、余弦相似度、KNN)以及一种基于类型优化惯性指标的新型聚类方法。在MovieLens数据集(610名用户,9,742部电影)上进行评估,混合框架通过结合多种算法并利用惯性分析验证聚类稳定性,显著提升了推荐准确率。

ABSTRACT

A recommender system, also known as a recommendation system, is a type of information filtering system that attempts to forecast a user's rating or preference for an item. This article designs and implements a complete movie recommendation system prototype based on the Genre, Pearson Correlation Coefficient, Cosine Similarity, KNN-Based, Content-Based Filtering using TFIDF and SVD, Collaborative Filtering using TFIDF and SVD, Surprise Library based recommendation system technology. Apart from that in this paper, we present a novel idea that applies machine learning techniques to construct a cluster for the movie based on genres and then observes the inertia value number of clusters were defined. The constraints of the approaches discussed in this work have been described, as well as how one strategy overcomes the disadvantages of another. The whole work has been done on the dataset Movie Lens present at the group lens website which contains 100836 ratings and 3683 tag applications across 9742 movies. These data were created by 610 users between March 29, 1996, and September 24, 2018.

研究动机与目标

  • 设计并实现一个统一的电影推荐系统,整合多种过滤技术。
  • 评估各类推荐方法(基于内容、协同、聚类)在个体应用中的优势与局限性。
  • 提出一种基于电影类型和惯性指标的新型聚类策略,以优化聚类数量。
  • 利用真实世界数据集,对比不同推荐算法的性能表现。
  • 提供一个综合性框架,以缓解推荐系统中的冷启动和稀疏性问题。

提出的方法

  • 系统采用基于TF-IDF的电影特征向量化进行内容过滤,并利用SVD实现降维与潜在因子建模。
  • 通过皮尔逊相关系数和余弦相似度实现协同过滤,以衡量用户-项目之间的相似性。
  • 应用K-最近邻(KNN)算法,基于相似用户或项目预测评分。
  • 提出一种新型聚类方法,按电影类型分组,并结合肘部法则与惯性指标确定最优聚类数量。
  • 使用Surprise库实现并基准测试协同过滤模型。
  • 所有方法均在MovieLens数据集(100,836条评分,3,683个标签,9,742部电影,610名用户)上进行评估,时间跨度为1996–2018年。

实验结果

研究问题

  • RQ1在MovieLens数据集上,不同推荐技术(基于内容、协同、聚类)在准确率和鲁棒性方面如何比较?
  • RQ2基于类型的聚类结合惯性优化是否能提升推荐性能与聚类稳定性?
  • RQ3各类推荐策略的关键局限性是什么?如何通过混合集成方式加以缓解?
  • RQ4TF-IDF、SVD与协同过滤的结合如何整体提升推荐质量?
  • RQ5基于类型与惯性分析,电影分组的最优聚类数量是多少?

主要发现

  • 混合推荐系统通过整合基于内容与协同过滤的优势,优于单一方法。
  • 在基于类型的聚类中引入惯性指标,有助于识别最优聚类数量,提升推荐分组的稳定性和可解释性。
  • 基于SVD的降维方法能有效减少噪声,并在基于内容与协同过滤模型中提升性能。
  • 采用皮尔逊相关系数与余弦相似度的协同过滤在评分预测方面表现优异,尤其在用户-项目交互密集区域。
  • 基于KNN的方法在稀疏数据场景下表现出强鲁棒性,通过利用相似用户或项目特征实现有效预测。
  • 通过在真实世界数据集上集成多种算法策略,系统成功缓解了冷启动与稀疏性问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。