[论文解读] HotelRec: a Novel Very Large-Scale Hotel Recommendation Dataset
本文介绍了HotelRec,一个新颖的大规模酒店推荐数据集,包含5000万条TripAdvisor评论,使其成为目前酒店领域中最大的公开可用数据集,也是拥有文本评论的单一领域中最大的推荐数据集。该数据集支持深度学习模型的基准测试,尽管数据稀疏性较高,NeuMF在评分预测和推荐任务中均取得了最先进性能。
Today, recommender systems are an inevitable part of everyone's daily digital routine and are present on most internet platforms. State-of-the-art deep learning-based models require a large number of data to achieve their best performance. Many datasets fulfilling this criterion have been proposed for multiple domains, such as Amazon products, restaurants, or beers. However, works and datasets in the hotel domain are limited: the largest hotel review dataset is below the million samples. Additionally, the hotel domain suffers from a higher data sparsity than traditional recommendation datasets and therefore, traditional collaborative-filtering approaches cannot be applied to such data. In this paper, we propose HotelRec, a very large-scale hotel recommendation dataset, based on TripAdvisor, containing 50 million reviews. To the best of our knowledge, HotelRec is the largest publicly available dataset in the hotel domain (50M versus 0.9M) and additionally, the largest recommendation dataset in a single domain and with textual reviews (50M versus 22M). We release HotelRec for further research: https://github.com/Diego999/HotelRec.
研究动机与目标
- 为解决研究社区中缺乏大规模、高质量酒店推荐数据集的问题。
- 提供一个包含丰富文本和多维度评论数据的基准数据集,用于训练和评估先进推荐系统。
- 支持在高度稀疏、文本丰富的酒店推荐数据背景下开展深度学习模型研究。
- 分析大规模真实世界酒店评论数据集的结构和统计特性,并在真实数据上评估模型性能。
- 发布可复现、公开可访问的数据集,以加速酒店推荐系统领域的创新。
提出的方法
- 通过爬取和清洗来自TripAdvisor的5000万条酒店评论构建数据集,包括用户资料、酒店URL、总体评分、摘要、全文评论、日期以及服务、位置、清洁度等维度的子评分。
- 将数据集预处理为k-core子集(5-core和20-core),以在不同数据稀疏性水平下评估模型性能。
- 评估了一系列基线模型,包括协同过滤(UserKNN、ItemKNN、PureSVD)、矩阵分解(GMF、MLP、NeuMF)以及基于神经网络的模型(TransNet、TransNet-Ext、NeuFM)。
- 评估指标包括均方误差(MSE)、均方根误差(RMSE)、命中率(HR@K)和归一化折损累计增益(NDCG@K),用于评分预测和推荐任务。
- 在完整数据集和k-core子集上训练并测试模型,以评估在数据稀疏性条件下的性能表现。
- 通过GitHub公开发布数据集,以支持可复现性和进一步研究。
实验结果
研究问题
- RQ1在具有丰富文本评论的大规模、稀疏酒店推荐数据集上,最先进深度学习模型的性能表现如何?
- RQ2数据稀疏性对协同过滤和矩阵分解模型在酒店领域性能有何影响?
- RQ3基于神经网络的模型能否有效从稀疏、文本丰富的酒店评论数据中学习?还是简单基线模型表现更优?
- RQ4数据集的k-core子集如何影响模型在评分预测和推荐任务中的泛化能力与性能表现?
- RQ5大规模真实世界酒店评论数据集的统计和结构特性是什么?与传统推荐数据集有何不同?
主要发现
- HotelRec是目前公开可用的最大酒店推荐数据集,包含5000万条评论,规模超过此前最大数据集(090万条)的60倍以上。
- NeuMF在所有评估指标中表现最佳,在20-core子集上的RMSE为0.4401,在5-core子集上的NDCG@10为0.7836。
- 在20-core子集上,均值基线(Mean)的表现优于更复杂的模型,表明在高度稀疏的设置下,简单基线模型可能具有竞争力。
- HFT(一种基于主题建模的矩阵分解模型)在5-core子集上表现最佳,可能得益于更大语料库下更优的词分布估计。
- 基于物品的协同过滤(ItemKNN)在两个k-core子集上均优于基于用户的(UserKNN)方法,表明在稀疏场景下性能更强。
- 非个性化基线模型RAND和POP的性能极低(HR@10 < 0.003),证实了建模用户偏好对实现有效个性化推荐的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。