[논문 리뷰] Combination of Diverse Ranking Models for Personalized Expedia Hotel Searches
이 논문은 ICDM 2013 경연 대회에서 개인화된 호텔 검색 순위를 위한 다양한 랭킹 모델—로지스틱 회귀, 기울기 부스팅, 랜덤 포레스트, 딥 네URAL 네트워크를 조합한 하이브리드 앙상블 접근법을 제시한다. z-score 정규화와 리스트와이즈 앙상블인 LambdaMART를 적용함으로써, 비공개 랭킹에서 NDCG@38 점수 0.53102를 기록하였으며, 이는 개별 모델에 비해 앙상블 기반의 모델 조합이 랭킹 성능 향상에 크게 기여한다는 것을 보여준다.
The ICDM Challenge 2013 is to apply machine learning to the problem of hotel ranking, aiming to maximize purchases according to given hotel characteristics, location attractiveness of hotels, user's aggregated purchase history and competitive online travel agency information for each potential hotel choice. This paper describes the solution of team "binghsu & MLRush & BrickMover". We conduct simple feature engineering work and train different models by each individual team member. Afterwards, we use listwise ensemble method to combine each model's output. Besides describing effective model and features, we will discuss about the lessons we learned while using deep learning in this competition.
연구 동기 및 목표
- ICDM 2013 경연 대회에서 개인화된 호텔 랭킹 성능을 향상시키기 위해 다양한 기계학습 모델을 조합하는 것.
- 제한된 레이블 데이터를 가진 대규모 호텔 랭킹에서 데이터 불균형 및 확장성 문제를 해결하는 것.
- 개인화된 검색를 위한 랭킹 학습에서 딥 러닝 및 앙상블 기법의 효과성을 평가하는 것.
- 모델 선택과 조합을 안내하기 위해 10% 내부 검증 세트를 활용한 강건한 검증 전략을 개발하는 것.
- 딥 네URAL 네트워크가 이 랭킹 작업에서 전통적 모델을 능가하거나 앙상블 성능을 향상시킬 수 있는지 탐구하는 것.
제안 방법
- 데이터 전처리(pandas 사용), 다양한 개별 모델 훈련, 모델 출력의 앙상블을 포함한 3단계 파이프라인을 활용하였다.
- 각 검색 리스트 내의 랭킹 맥락을 포착하기 위해 price_usd, prop_starrating, prop_location_score2와 같은 리스트와이즈 특징을 사용하였다.
- 복합 특징(예: srch_room_count * max(srch_booking_window) + srch_booking_window) 및 실수형 특징에 대한 버킷화를 포함한 특징 공학 기법을 적용하였다.
- 특히 prop_location_score2에 대해 국적 기반 첫 번째 사분위수 보간을 사용하여 결측치를 처리하였다.
- 트리 기반 모델과 딥 네URAL 네트워크 훈련을 위해 1:1 양성/음성 비율의 균형 임의 샘플링을 사용하여 수렴성과 일반화 성능을 향상시켰다.
- 트리 기반 모델의 훈련 시간을 단축시키기 위해 prop_country_id 기반으로 데이터를 분할하여 각 국별로 별도의 모델을 훈련시켰다.
- 모델 간 서로 다른 점수 범위를 보정하기 위해 쿼리 수준의 z-score 정규화를 적용하였으며, 과적합을 방지하기 위해 수동으로 하이퍼파라미터를 튜닝하였다.
- z-score 정규화된 모델 출력을 사용하여 LambdaMART를 통한 리스트와이즈 앙상블을 수행함으로써 NDCG 최적화를 달성하고 최종 모델을 도출하였다.
실험 결과
연구 질문
- RQ1개별 모델에 비해 다양한 랭킹 모델을 조합함으로써 개인화된 호텔 검색에서 NDCG 성능을 크게 향상시킬 수 있는가?
- RQ2리스트와이즈 랭킹 설정에서 이질적인 모델 출력을 정규화하기 위해 z-score 정규화가 얼마나 효과적인가?
- RQ3딥 러닝 모델(예: 딥 네URAL 네트워크, 드롭아웃 로지스틱 회귀)을 앙상블의 일부로 사용할 경우 랭킹 성능 향상에 어느 정도 기여하는가?
- RQ4각 국별로 별도의 모델을 훈련시는 것(prop_country_id 기반)이 대규모 호텔 랭킹에서 성능 향상이나 확장성 향상에 기여하는가?
- RQ5저데이터 환경에서 딥 러닝의 실질적 한계는 무엇이며, 표현 학습을 향상시키기 위해 정규화 및 미리 훈련 기법을 어떻게 개선할 수 있는가?
주요 결과
- z-score 정규화와 리스트와이즈 LambdaMART를 활용한 최종 앙상블 모델은 비공개 랭킹에서 NDCG@38 점수 0.53102를 기록하여 5위를 기록하였다.
- 쿼리 수준의 z-score 정규화는 원본 점수 평균화 및 전역 z-score보다 유의미하게 뛰어난 성능을 보였으며, 과적합을 방지하기 위해 수동 튜닝이 적용되었다.
- 모델 출력을 특징으로 사용한 GBM 앙상블은 로컬 테스트 세트에서 NDCG@38 0.53573를 기록했지만, 공개 테스트 세트에서는 0.53053으로 하락하여 과적합 위험이 있음을 시사했다.
- 딥 러닝 모델(ReLU 및 Maxout 네트워크 포함)은 비공개 랭킹에서 약 0.526 NDCG@38를 기록했고, 드롭아웃 로지스틱 회귀는 0.52729를 기록하여 모두 최종 리스트와이즈 앙상블에 비해 성능이 열등했다.
- 균형 임의 샘플링은 훈련 안정성을 향상시키고 오류율을 50%에서 근처 10%로 감소시켰지만, 로컬 NDCG는 약 ~0.49로 거의 향상되지 않아 최종 랭킹 품질에 미치는 영향은 제한적이었다.
- 연구에서 오토인코더의 재구성 오차가 최적의 표현 학습을 반영하지 못할 수 있으며, 딥 네트워크에 대한 특징 이진화를 위한 버킷화 방법이 최적은 아닐 수 있음을 발견하여, 더 나은 정규화 기법 개선의 여지가 있음을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.