Skip to main content
QUICK REVIEW

[논문 리뷰] Hotel2vec: Learning Attribute-Aware Hotel Embeddings with Self-Supervision

Ali Sadeghian, Shervin Minaee|arXiv (Cornell University)|2019. 09. 30.
Recommender Systems and Techniques참고 문헌 20인용 수 7
한 줄 요약

이 논문은 사용자 클릭 시퀀스, 구조화된 호텔 속성(예: 별점, 편의시설), 지리적 정보를 동시에 모델링함으로써 속성 인식형 호텔 임베딩을 학습하는 자기지도 학습 신경망인 Hotel2vec을 제안한다. 이러한 신호들을 통합된 해석 가능한 임베딩으로 융합함으로써, 특히 추천 성능이 낮은 신규 호텔에 대해 뛰어난 성능을 발휘하며, 클릭 데이터만을 사용하는 기준 모델 대비 냉시작 시나리오에서 최대 4.71 hits@10의 성능 향상을 달성한다.

ABSTRACT

We propose a neural network architecture for learning vector representations of hotels. Unlike previous works, which typically only use user click information for learning item embeddings, we propose a framework that combines several sources of data, including user clicks, hotel attributes (e.g., property type, star rating, average user rating), amenity information (e.g., the hotel has free Wi-Fi or free breakfast), and geographic information. During model training, a joint embedding is learned from all of the above information. We show that including structured attributes about hotels enables us to make better predictions in a downstream task than when we rely exclusively on click data. We train our embedding model on more than 40 million user click sessions from a leading online travel platform and learn embeddings for more than one million hotels. Our final learned embeddings integrate distinct sub-embeddings for user clicks, hotel attributes, and geographic information, providing an interpretable representation that can be used flexibly depending on the application. We show empirically that our model generates high-quality representations that boost the performance of a hotel recommendation system in addition to other applications. An important advantage of the proposed neural model is that it addresses the cold-start problem for hotels with insufficient historical click information by incorporating additional hotel attributes which are available for all hotels.

연구 동기 및 목표

  • 클릭 기록이 부족하거나 없는 호텔의 냉시작 문제를 해결하기 위해 호텔의 구조화된 메타데이터를 활용한다.
  • 클릭 스트림 데이터만으로는 달성할 수 없는 수준의 호텔 임베딩 품질 향상.
  • 다양한 의미적 측면(예: 평점, 편의시설, 위치)을 분리하고 융합할 수 있는 융통성 있고 해석 가능한 임베딩 프레임워크 개발.
  • 전체 재학습 없이도 호텔 속성이 변경될 경우에만 해당 속성에 대해 재인코딩하여 임베딩을 동적으로 업데이트할 수 있도록 지원.
  • 구조화된 속성 정보를 통합할 경우 추천 작업에서 더 뛰어난 최종 성능을 달성함을 입증한다.

제안 방법

  • 스킵그램 모델을 확장하여 사용자 클릭 시퀀스, 호텔 속성(예: 별점, 무료 와이파이), 사용자 평점, 지리 좌표 등 다양한 정보 소스를 동시에 인코딩한다.
  • 각 모odal(클릭, 속성, 위치, 평점)에 대해 별도의 서브임베딩을 학습한 후, 이를 각 호텔의 단일 통합 임베딩으로 융합한다.
  • 대규모 온라인 여행 플랫폼의 4,000만 개 이상의 클릭 세션을 대상으로 자기지도 학습을 수행하여 모델을 사전학습하며, 이는 100만 개 이상의 호텔을 포함한다.
  • 음성 샘플링과 지수 감소 학습률을 가지는 확률적 경사 하강법를 적용하여 최적화를 수행하며, 수렴성과 일반화 성능을 고려해 하이퍼파rameter를 튜닝한다.
  • 변경된 속성(예: 새로운 별점 또는 추가된 편의시설)에 대해서만 재인코딩하여 전체 재학습 없이도 임베딩을 동적으로 업데이트할 수 있도록 지원한다.
  • 최종 임베딩을 해석 가능한 구성요소로 분해함으로써, 클릭, 위치, 평점, 속성 등 각 성분이 임베딩에 기여하는 방식을 독립적으로 분석할 수 있다.

실험 결과

연구 질문

  • RQ1클릭 스트림 데이터에 구조화된 호텔 속성을 추가로 융합할 경우, 클릭 전용 모델 대비 학습된 호텔 임베딩의 품질이 향상되는가?
  • RQ2구조화된 메타데이터의 포함 여부가 클릭 기록이 극히 적은 호텔의 냉시작 문제를 어느 정도 완화하는가?
  • RQ3각 성분(클릭, 속성, 위치, 평점)이 최종 임베딩에 기여하는 방식은 어떻게 되며, 이를 독립적으로 해석할 수 있는가?
  • RQ4제안된 모델은 클릭 데이터에만 의존하는 기준 모델 대비 동일 시장 내 미리보지 않은 호텔에 대해 더 잘 일반화되는가?
  • RQ5모델의 학습 동역학 및 최적화 전략은 다각도로 다양하고 대규모 데이터셋에서 수렴성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 풍부한 정보가 반영된 모델(Hotel2vec)은 냉시작 호텔에 대해 2.89 hits@10의 성능을 기록하며, 동일한 시장 내 예측 작업에서 세션 전용 모델(0.21 hits@10)보다 뚜렷이 뛰어난 성능을 보였다.
  • 냉시작 호텔에 히우리스틱 보간법을 적용한 경우에도, 풍부한 정보가 반영된 모델은 보간된 세션 전용 모델(2.70 hits@10)을 초월하여 4.71 hits@10의 성능을 달성했다.
  • 32차원 임베딩을 사용한 모델(Enriched-32)은 냉시작 평가에서 69.46 hits@1000의 성능을 기록했으며, 세션 전용 기준 모델 대비 45.01 hits@1000보다 뛰어난 성능을 보였다.
  • 학습 중 더 많은 음성 샘플을 사용할 경우, 비록 배치당 계산 비용이 증가하지만 학습 시간이 단축되고 수렴 속도가 향상된다.
  • Adam과 같은 적응형 최적화 기법보다 지수 감소 학습률을 가지는 SGD가 더 뛰어난 성능을 보였으며, 이는 대규모이고 다양한 데이터셋에서 초기 학습 단계에서의 과적합을 줄여주기 때문이다.
  • 모델의 해석 가능한 서브임베딩은 모듈러한 사용이 가능하다. 예를 들어, 속성 또는 위치 성분만을 사용하는 방식으로 다양한 추천 및 검색 작업에灵活하게 적용할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.