[논문 리뷰] Inferring Complementary Products from Baskets and Browsing Sessions
이 논문은 쇼핑카트 구매 기록과 브라우징 세션 데이터를 함께 학습하여 보완 상품 추천 성능을 향상시키는 다중 작업 학습 모델 BB2vec을 제안한다. 두 데이터 유형을 활용함으로써 BB2vec는 특히 저구매 제품에 대해 구매 데이터만을 사용하는 모델보다 우수한 성능을 보이며, 다양한 전자상거래 데이터셋에서 최신 기술 수준의 성능을 기록하면서도 추천의 냉각기 문제를 효과적으로 완화한다.
Complementary products recommendation is an important problem in e-commerce. Such recommendations increase the average order price and the number of products in baskets. Complementary products are typically inferred from basket data. In this study, we propose the BB2vec model. The BB2vec model learns vector representations of products by analyzing jointly two types of data - Baskets and Browsing sessions (visiting web pages of products). These vector representations are used for making complementary products recommendation. The proposed model alleviates the cold start problem by delivering better recommendations for products having few or no purchases. We show that the BB2vec model has better performance than other models which use only basket data.
연구 동기 및 목표
- 구매 및 브라우징 행동 데이터를 모두 활용하여 전자상거래 보완 상품 추천에서의 냉각기 문제를 해결하기 위해.
- 구매 기록이 적거나 없는 제품의 추천 정확도를 향상시키기 위해 쇼핑카트 데이터와 세션 데이터를 결합하기 위해.
- 이질적인 사용자 상호작용 신호로부터 공유되는 제품 표현을 학습하는 스케일링 가능하고 계산적으로 효율적인 모델을 개발하기 위해.
- 쇼핑카트와 브라우징 세션 데이터를 함께 모델링할 경우, 단일 쇼핑카트 데이터에 의존하는 모델보다 성능이 뛰어나다는 것을 입증하기 위해.
제안 방법
- BB2vec는 다중 작업 학습 프레임워크를 사용하여 쇼핑카트 내 상품 공존 패턴과 브라우징 세션 패턴을 동시에 최적화함으로써 상품의 분산 벡터 표현(임베딩)을 학습한다.
- 모델은 랭킹 손실 함수를 사용한 음성 샘플링 기반 학습을 통해 아이템 임베딩을 훈련하며, 그 목표는 진짜 공존 상품을 음성 샘플보다 더 높게 랭킹하는 것이다.
- 쇼핑카트와 브라우징 세션 데이터에서 유도된 공통된 임베딩 공간을 도입하여 두 데이터 유형 간 지식 전이를 가능하게 한다.
- 샘플링 기반 접근 방식을 사용함으로써 대량의 브라우징 데이터를 효율적으로 처리할 수 있도록 스케일링 가능한 학습 목표를 설계하였다.
- 쿼리와 양성 상품 임베딩 간의 내적값이 음성 샘플보다 높아지도록 유도하는 대비 목표를 적용한다.
- 최종 추천 점수는 공통된 공간 내에서 쿼리 상품 임베딩과 후보 상품 임베딩 간의 내적값으로 산출된다.
실험 결과
연구 질문
- RQ1쇼핑카트와 브라우징 세션 데이터를 함께 모델링할 경우, 단일 쇼핑카트 데이터에 의존하는 모델보다 보완 상품 추천 성능이 향상되는가?
- RQ2BB2vec 모델은 구매 기록이 적거나 없는 제품에 대해 어떻게 성능을 발휘하는가, 즉 냉각기 문제를 완화하는가?
- RQ3학습 과정에서 랭킹 기반 목표 함수를 사용할지 분류 기반 목표 함수를 사용할지의 영향은 무엇인가?
- RQ4대량의 브라우징 세션 데이터를 처리할 때 BB2vec 모델의 확장성은 어떠한가?
- RQ5다양한 희소성 수준을 가진 전자상거래 데이터셋 간에 모델이 잘 일반화되는가?
주요 결과
- BB2vec는 모든 데이터셋과 평가 지표에서 최고의 예측 성능를 기록하며, 단일 쇼핑카트 데이터만을 사용하는 최신 기술 수준의 모델들을 능가한다.
- 구매 기록이 적거나 없는 제품에 대해 HitRate@10 성능이 크게 향상되었으며, 특히 CIKM’16 및 RecSys’15와 같은 희소 데이터셋에서 성능 격차가 가장 두드러졌다.
- BB2vec의 랭킹 기반 변형(BB2vec, rank.)은 분류 기반 변형(BB2vec, class.)보다 성능이 뛰어나, 이 작업에 있어 랭킹 기반 최적화가 더 효과적임을 시사한다.
- BB2vec는 훈련 세트에서 구매 기록이 전혀 없는 제품에 대해서도 추천을 생성할 수 있으며, 이는 쇼핑카트 중심 모델에서 존재하지 않는 능력이다.
- 효율적인 음성 샘플링 목표 함수 덕분에 대량의 브라우징 데이터를 처리하더라도 BB2vec의 확장성은 유지된다.
- 하이퍼파rameter 튜닝 결과, 최적의 임베딩 차원과 정규화는 데이터셋에 따라 달라지며, BB2vec는 prod2vec보다 더 작은 차원(d=100 등)을 사용함으로써 더 뛰어난 데이터 효율성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.