Skip to main content
QUICK REVIEW

[論文レビュー] HotelRec: a Novel Very Large-Scale Hotel Recommendation Dataset

Diego Antognini, Boi Faltings|arXiv (Cornell University)|Feb 17, 2020
Recommender Systems and Techniques参考文献 27被引用数 11
ひとこと要約

本稿では、5000万件のTripAdvisorレビューを含む、新しい大規模ホテルレコメンデーションデータセットHotelRecを紹介する。これはホテル分野で最も大規模な公開データセットであり、テキストレビューを含む単一ドメインで最大のレコメンデーションデータセットである。このデータセットにより、深層学習モデルのベンチマークが可能となり、高スパarsityな状況下でもNeuMFがレーティング予測およびレコメンデーションタスクの両方で最先端の性能を達成した。

ABSTRACT

Today, recommender systems are an inevitable part of everyone's daily digital routine and are present on most internet platforms. State-of-the-art deep learning-based models require a large number of data to achieve their best performance. Many datasets fulfilling this criterion have been proposed for multiple domains, such as Amazon products, restaurants, or beers. However, works and datasets in the hotel domain are limited: the largest hotel review dataset is below the million samples. Additionally, the hotel domain suffers from a higher data sparsity than traditional recommendation datasets and therefore, traditional collaborative-filtering approaches cannot be applied to such data. In this paper, we propose HotelRec, a very large-scale hotel recommendation dataset, based on TripAdvisor, containing 50 million reviews. To the best of our knowledge, HotelRec is the largest publicly available dataset in the hotel domain (50M versus 0.9M) and additionally, the largest recommendation dataset in a single domain and with textual reviews (50M versus 22M). We release HotelRec for further research: https://github.com/Diego999/HotelRec.

研究の動機と目的

  • 研究コミュニティにおける大規模かつ高品質なホテルレコメンデーションデータセットの不足に対処すること。
  • 高品質なテキストおよびマルチアスペクトレビューを含むベンチマークデータセットを提供し、先進的なレコメンデーションシステムの学習と評価を可能にすること。
  • 非常にスパースでテキスト豊富なホテルレコメンデーションデータを文脈として、深層学習モデルの研究を可能にすること。
  • 非常に大規模なホテルレビューの構造的・統計的特性を分析し、実世界のデータ上でモデルのパフォーマンスを評価すること。
  • 再現可能で公開可能なデータセットをリリースし、ホテルレコメンデーションシステム分野におけるイノベーションを加速すること。

提案手法

  • データセットは、ユーザーのプロフィール、ホテルのURL、総合評点、要約、全文レビュー、日付、およびサービス・ロケーション・清潔さなどのアスペクト別評点を含む、TripAdvisorから抽出・整備した5000万件のホテルレビューから構築された。
  • データスパarsityの異なるレベルでのモデルパフォーマンス評価を目的に、kコアサブセット(5コアおよび20コア)に事前処理された。
  • 協調フィルタリング(UserKNN、ItemKNN、PureSVD)、行列分解(GMF、MLP、NeuMF)、ニューラルネットワークベースのモデル(TransNet、TransNet-Ext、NeuFM)を含む、さまざまなベースラインモデルが評価された。
  • 評価指標には、レーティング予測およびレコメンデーションタスクの両方で、平均二乗誤差(MSE)、平均二乗誤差の平方根(RMSE)、Hit Ratio(HR@K)、正規化割引累積利得(NDCG@K)が用いられた。
  • モデルは、フルデータセットおよびkコアサブセットの両方で訓練・テストされ、データスパarsity下でのパフォーマンスを評価した。
  • データセットはGitHub経由で公開され、再現性およびさらなる研究を支援した。

実験結果

リサーチクエスチョン

  • RQ1豊富なテキストレビューを含む非常に大規模でスパースなホテルレコメンデーションデータセットにおいて、最先端の深層学習モデルの性能はどのように比較されるか?
  • RQ2協調フィルタリングおよび行列分解モデルのパフォーマンスに、データスパarsityが及ぼす影響は何か?
  • RQ3ニューラルネットワークベースのモデルは、スパースでテキスト豊富なホテルレビューのデータから効果的に学習できるか、それとも単純なベースラインが優れているか?
  • RQ4kコアサブセットが、レーティング予測およびレコメンデーションタスクにおけるモデルの汎化性能に与える影響は何か?
  • RQ5大規模で実世界のホテルレビューの統計的・構造的特性は何か?また、従来のレコメンデーションデータセットとはどのように異なるか?

主な発見

  • HotelRecは、5000万件のレビューを有する、公開済みの最大のホテルレコメンデーションデータセットであり、前回の最大データセット(0.9百万件)の60倍以上も大きい。
  • NeuMFは、すべての評価指標で最高のパフォーマンスを示し、20コアサブセットではRMSEが0.4401、5コアサブセットではNDCG@10が0.7836を記録した。
  • 平均ベースライン(Mean)は20コアサブセットでより複雑なモデルを上回った。これは、極めてスパースな状況下では単純なベースラインが競争力を持つ可能性があることを示唆している。
  • HFT(トピックモデリングに基づく行列分解モデル)は5コアサブセットで最高のパフォーマンスを達成した。これは、より大きなテキストコーパスで語の分布推定がより正確に行えるためと考えられる。
  • アイテムベースの協調フィルタリング(ItemKNN)は、両方のkコアサブセットでユーザーベースの方法(UserKNN)を上回った。これは、スパースな状況下でも優れた性能を示していることを示している。
  • 非パーソナライズドベースライン(RANDおよびPOP)は非常に低いパフォーマンス(HR@10 < 0.003)を示した。これは、効果的なパーソナライゼーションのためにはユーザーの好みをモデル化する必要があることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。