[논문 리뷰] A Multimodal Recommender System for Large-scale Assortment Generation in E-commerce
이 논문은 ResNet-50에서 추출한 깊이 있는 시각적 특징과 PolyLDA를 통한 텍스트 속성을 융합하여 전자상거래에서 통합적이고 시각적으로 호환되는 가구 세트를 생성하는 다중모odal 추천 시스템을 제안한다. 이 시스템은 시각적 유사성에 과도하게 의존하는 시각 전용 모델에 비해 세트의 다양성과 스타일 호환성에서 뛰어난 성능을 보이며, 온라인 A/B 테스트를 통해 두 모odal이 모두 사용될 경우 사용자 참여도가 향상됨을 확인했다.
E-commerce platforms surface interesting products largely through product recommendations that capture users' styles and aesthetic preferences. Curating recommendations as a complete complementary set, or assortment, is critical for a successful e-commerce experience, especially for product categories such as furniture, where items are selected together with the overall theme, style or ambiance of a space in mind. In this paper, we propose two visually-aware recommender systems that can automatically curate an assortment of living room furniture around a couple of pre-selected seed pieces for the room. The first system aims to maximize the visual-based style compatibility of the entire selection by making use of transfer learning and topic modeling. The second system extends the first by incorporating text data and applying polylingual topic modeling to infer style over both modalities. We review the production pipeline for surfacing these visually-aware recommender systems and compare them through offline validations and large-scale online A/B tests on Overstock. Our experimental results show that complimentary style is best discovered over product sets when both visual and textual data are incorporated.
연구 동기 및 목표
- 전자상거래에서 고려가 필요한 제품(예: 거실 가구)에 대해 대규모이고 시각적으로 통합된 가구 세트를 생성하는 데 도전하는 것.
- 시각적 유사성에 과도하게 의존하는 시각 전용 추천 시스템의 한계를 극복하여, 반복적이고 상호 보완성이 없는 선택을 방지하는 것.
- 시각적 특징과 텍스트 제품 속성을 융합함으로써 스타일 호환성과 세트 추천의 다양성이 향상되는지 탐색하는 것.
- 초기 사용자 및 신규 제품에 대한 역사적 상호작용 데이터가 없더라도 작동할 수 있도록 스케일러블하고 프로덕션 환경에 적합한 시스템을 개발하는 것.
- 실제 전자상거래 플랫폼에서 대규모 온라인 A/B 테스트를 통해 다중모달 학습의 효과를 검증하는 것.
제안 방법
- 사전 훈련된 ResNet-50을 활용한 전이 학습을 통해 제품 이미지에서 깊이 있는 시각적 특징을 추출하고, 시각적 단어의 집합 표현을 형성한다.
- 시각적 특징 활성화에 대해 잠재적 디리히레 분포 분석(Latent Dirichlet Allocation, LDA)을 적용하여 제품 간의 스타일 그룹화를 모델링한다.
- 제약 조건이 있는 2차 배낭 문제(Quadratic Knapsack Problem, QKP)의 근사해를 구하기 위해 탐욕 알고리즘을 사용하여 예산 및 시드 제약 조건 내에서 상호 시각적 호환성을 극대화하는 항목을 선택한다.
- 다중모달 변형은 이에 더해 다국어 LDA(Polylingual LDA, PolyLDA)를 적용하여 시각적 및 텍스트적 특징을 함께 모델링함으로써 교차 모달 스타일 탐지 기능을 제공한다.
- 제품 제목, 설명, 태그와 같은 텍스트 속성을 시각적 특징과 동일한 잠재 공간에 임bedding하여 공동 주제 모델링을 가능하게 한다.
- 최종 추천 세트는 시드 제품와 주제적으로 일치하고, 시각적 및 텍스트적 공간에서 최대한의 호환성을 확보한 항목을 선택하여 생성된다.
실험 결과
연구 질문
- RQ1시각적 인지 기반 추천 시스템은 시각 전용 시스템에 비해 더 통합적이고 다양한 가구 세트를 생성할 수 있는가?
- RQ2제품의 텍스트 속성을 통합함으로써 추천 세트의 시각적 호환성과 스타일 다양성이 향상되는가?
- RQ3PolyLDA를 통한 시각적 및 텍스트적 특징의 공동 모델링은 단일 모달 주제 모델링에 비해 스타일 트렌드를 얼마나 잘 포착하는가?
- RQ4실제 전자상거래 환경에서 다중모달 접근 방식은 사용자 참여도를 얼마나 향상시키는가?
- RQ5기존 상호작용 데이터가 없는 냉각기 사용자와 신규 제품을 효과적으로 처리할 수 있는가?
주요 결과
- 다중모달 변형은 세트 호환성에 대해 평균 재결합 점수(Jaccard score) 0.0027을 기록하여, 시각 전용 변형의 0.0015보다 유의미하게 높은 성능을 보였다. 이는 더 뛰어난 시각적 호환성을 의미한다.
- 다중모달 시스템은 최대 재결합 점수 0.0362를 기록하여, 시각 전용 변형의 0.0220보다 두 배 이상 높았으며, 이는 매우 호환성 있는 세트를 생성하는 데 뛰어난 능력을 지닌 것을 보여준다.
- 다중모달 세트는 최대 20개의 주제를 포함하는 등 더 넓은 주제 범위를 갖는 반면, 시각 전용 세트는 주로 1~4개의 주제로 국한되어 있어 더 뛰어난 다양성을 보였다.
- LDA에 비해 PolyLDA는 더 다양한 주제 분포를 생성했으며, 제품들이 하나 또는 두 개의 주제에 지배당하는 것보다는 여러 주제의 혼합으로 더 잘 표현되었다.
- 시스템이 여러 주제를 융합할 수 있었기에, 시각 전용 모델이 종종 유사한 외관의 항목을 추천하는 것과는 달리, 보다 보완적이고 반복적이지 않은 선택을 가능하게 했다.
- 온라인 A/B 테스트 결과, 다중모달 시스템이 사용자 참여 지표를 향상시켜, 실세계 구현에서 시각-텍스트 공동 모델링의 우수성을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.