[논문 리뷰] HotelRec: a Novel Very Large-Scale Hotel Recommendation Dataset
이 논문은 5,000만 건의 TripAdvisor 리뷰를 포함하는 새로운 대규모 호텔 추천 데이터셋인 HotelRec을 소개한다. 이는 호텔 분야에서 공개된 최대의 데이터셋이며, 텍스트 리뷰를 포함한 단일 도메인 추천 데이터셋 중 가장 크다. 이 데이터셋은 딥러닝 모델의 벤치마킹을 가능하게 하며, 높은 데이터 희소성에도 불구하고 NeuMF가 평점 예측 및 추천 작업 모두에서 최고 성능을 기록했다.
Today, recommender systems are an inevitable part of everyone's daily digital routine and are present on most internet platforms. State-of-the-art deep learning-based models require a large number of data to achieve their best performance. Many datasets fulfilling this criterion have been proposed for multiple domains, such as Amazon products, restaurants, or beers. However, works and datasets in the hotel domain are limited: the largest hotel review dataset is below the million samples. Additionally, the hotel domain suffers from a higher data sparsity than traditional recommendation datasets and therefore, traditional collaborative-filtering approaches cannot be applied to such data. In this paper, we propose HotelRec, a very large-scale hotel recommendation dataset, based on TripAdvisor, containing 50 million reviews. To the best of our knowledge, HotelRec is the largest publicly available dataset in the hotel domain (50M versus 0.9M) and additionally, the largest recommendation dataset in a single domain and with textual reviews (50M versus 22M). We release HotelRec for further research: https://github.com/Diego999/HotelRec.
연구 동기 및 목표
- 연구 공동체에서 대규모이고 고품질의 호텔 추천 데이터셋이 부족한 문제를 해결하기 위해.
- 고도화된 추천 시스템을 훈련하고 평가하기 위한 풍부한 텍스트 및 다중 측면 리뷰 데이터를 포함한 벤치마크 데이터셋을 제공하기 위해.
- 매우 희소하고 텍스트 기반의 호텔 추천 데이터 환경에서 딥러닝 모델 연구를 가능하게 하기 위해.
- 매우 대규모의 실세계 호텔 리뷰 데이터셋의 구조적 및 통계적 특성을 분석하고, 실제 데이터에서 모델 성능을 평가하기 위해.
- 재현 가능하고 공개 가능한 데이터셋을 제공하여 호텔 추천 시스템 분야의 혁신을 가속화하기 위해.
제안 방법
- 5,000만 건의 호텔 리뷰를 TripAdvisor에서 크롤링하고 정제하여, 사용자 프로필, 호텔 URL, 종합 평점, 요약, 전체 텍스트 리뷰, 날짜, 서비스, 위치, 청결도 등의 요소에 대한 하위 평점 정보를 포함한 데이터셋을 구축하였다.
- 다양한 데이터 희소성 수준에서 모델 성능을 평가하기 위해 k-core 서브셋(5-core 및 20-core)으로 사전 처리하였다.
- 협업 필터링(UserKNN, ItemKNN, PureSVD), 행렬 분해(GMF, MLP, NeuMF), 신경망 기반 모델(TransNet, TransNet-Ext, NeuFM)을 포함한 다양한 베이스라인 모델을 평가하였다.
- 평가 지표로는 평점 예측 및 추천 작업에 대해 평균 제곱오차(MSE), 최소 제곱근 오차(RMSE), 히트 비율(HR@K), 정규화된 할인 누적 수익(NDCG@K)를 사용하였다.
- 모델은 전체 데이터셋과 k-core 서브셋 모두에서 훈련 및 테스트하여 데이터 희소성 조건 하에서의 성능을 평가하였다.
- 재현 가능성을 높이고 향후 연구를 지원하기 위해 GitHub를 통해 공개적으로 데이터셋을 배포하였다.
실험 결과
연구 질문
- RQ1매우 대규모이고 희소한, 풍부한 텍스트 리뷰를 포함한 호텔 추천 데이터셋에서 최신 딥러닝 모델의 성능는 어떻게 비교되는가?
- RQ2데이터 희소성이 호텔 도메인의 협업 필터링 및 행렬 분해 모델의 성능에 어떤 영향을 미치는가?
- RQ3신경망 기반 모델은 희소하고 풍부한 텍스트 기반의 호텔 리뷰 데이터로부터 효과적으로 학습할 수 있는가, 아니면 간단한 베이스라인 모델이 더 뛰어난가?
- RQ4데이터셋의 k-core 서브셋은 평점 예측 및 추천 작업에서 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
- RQ5대규모 실세계 호텔 리뷰 데이터셋의 통계적 및 구조적 특성은 무엇이며, 전통적인 추천 데이터셋과 어떻게 다를까?
주요 결과
- HotelRec는 공개된 최대의 호텔 추천 데이터셋으로, 5,000만 건의 리뷰를 보유하고 있으며, 이는 이전까지 가장 큰 데이터셋(90만 건)의 60배 이상이다.
- NeuMF는 모든 평가 지표에서 최고 성능을 기록했으며, 20-core 서브셋에서 RMSE가 0.4401, 5-core 서브셋에서 NDCG@10가 0.7836을 기록했다.
- 20-core 서브셋에서 평균 베이스라인( Mean )이 더 복잡한 모델들을 능가하여, 매우 희소한 환경에서는 단순한 베이스라인이 경쟁력 있는 성능을 낼 수 있음을 시사한다.
- HFT(주제 모델링 기반 행렬 분해 모델)는 5-core 서브셋에서 가장 뛰어난 성능을 기록했으며, 더 큰 텍스트 코퍼스에서 단어 분포 추정이 더 정확하기 때문일 것이다.
- ItemKNN(아이템 기반 협업 필터링)은 두 k-core 서브셋 모두에서 UserKNN(사용자 기반)보다 뛰어난 성능을 보였으며, 이는 희소한 환경에서 더 강력한 성능을 보임을 시사한다.
- 비개인화된 베이스라인 모델인 RAND와 POP는 매우 낮은 성능(HR@10 < 0.003)을 보였으며, 효과적인 개인화를 위해서는 사용자 선호도를 모델링할 필요가 있음을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.