[논문 리뷰] Contrastive Learning for Interactive Recommendation in Fashion
이 논문은 역사적 사용자 데이터에 의존하지 않고 사용자가 제공한 텍스트 요청에서 개인화된 패션 아이템을 추천하는 대비 학습 기반 모델인 WhisperLite를 제안한다. CLIP 임베딩과 이진 교차 엔트로피 및 대비 손실을 조합한 복합 손실을 활용함으로써 WhisperLite는 실제 패션 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 랜덤 기반 모델 대비 인간 평가에서 뛰어난 관련성과 일관성을 보였다.
Recommender systems and search are both indispensable in facilitating personalization and ease of browsing in online fashion platforms. However, the two tools often operate independently, failing to combine the strengths of recommender systems to accurately capture user tastes with search systems' ability to process user queries. We propose a novel remedy to this problem by automatically recommending personalized fashion items based on a user-provided text request. Our proposed model, WhisperLite, uses contrastive learning to capture user intent from natural language text and improves the recommendation quality of fashion products. WhisperLite combines the strength of CLIP embeddings with additional neural network layers for personalization, and is trained using a composite loss function based on binary cross entropy and contrastive loss. The model demonstrates a significant improvement in offline recommendation retrieval metrics when tested on a real-world dataset collected from an online retail fashion store, as well as widely used open-source datasets in different e-commerce domains, such as restaurants, movies and TV shows, clothing and shoe reviews. We additionally conduct a user study that captures user judgements on the relevance of the model's recommended items, confirming the relevancy of WhisperLite's recommendations in an online setting.
연구 동기 및 목표
- 자율 추천 시스템과 검색 도구 사이의 격차를 해소하기 위해, 자유형 텍스트 요청에서 개인화된 추천을 가능하게 하기 위해.
- 특히 콜드 스타트 사용자를 대상으로 역사적 클릭 스트림 또는 구매 데이터에 의존하지 않고 자연어 기반 기술 설명으로부터 사용자 의도를 모델링하기 위해.
- 사용자 요청이 노이즈가 많거나 애매하거나 상반된 경우, 스타일리스트가 레이블링한 데이터의 레이블 노이즈가 존재하는 상황에서도 추천 품질을 향상시키기 위해.
- 실제 및 오픈소스 데이터셋을 활용하여 다양한 도메인으로의 일반화 능력을 검증하기 위해.
- 실제 환경에서의 성능을 평가하기 위해 Amazon Mechanical Turk를 활용한 인간 연구를 수행하기 위해.
제안 방법
- WhisperLite는 사전 학습된 CLIP 이미지 및 텍스트 인코더를 조합하고, 미세조정된 피드포워드 네트워크를 사용하여 사용자 텍스트 요청과 패션 제품 특징을 공유 임베딩 공간으로 매핑한다.
- 모델는 이진 교차 엔트로피를 통한 아이템 관련성 예측과 관련 있는 텍스트-제품 쌍을 정렬하기 위한 대비 손실을 조합한 복합 손실 함수를 사용하여 훈련된다.
- 대비 학습은 관련된 텍스트-제품 쌍(긍정적 쌍)을 임베딩 공간에서 가까이 모으고, 관련이 없는 조합(부정적 쌍)은 멀리 떼어내는 데 사용된다.
- CLIP 모델의 하위 레이어를 미세조정하지 않고 동결함으로써 일반화 능력을 유지하고 노이즈 간섭을 줄이기 위해, 상단 두 개의 퍼셉트론만 훈련한다.
- 모델는 여러 데이터셋에서의 오프라인 평가와 자격을 갖춘 MTurk 작업자들이 5점 척도로 추천 관련성을 평가하는 온라인 인간 연구를 통해 평가된다.
- 제거 분석은 WhisperLite가 전체 미세조정 기반 모델(Whisper)과 비교하여 CLIP 레이어를 동결함으로써 노이즈가 많은 실제 데이터에서 성능 향상을 이룬다는 것을 보여준다.
실험 결과
연구 질문
- RQ1역사적 사용자 데이터 없이도 자유형 텍스트 요청을 관련 패션 제품 추천으로 효과적으로 매핑할 수 있는 대비 학습 접근법이 가능한가?
- RQ2전체 미세조정 대비 부분적 미세조정 전략의 선택이 노이즈가 많은 실제 패션 추천 데이터에서 성능에 어떤 영향을 미치는가?
- RQ3제안된 모델이 의류, 영화, 음식점, 신발과 같은 다양한 전자상거래 도메인으로 일반화되는 정도는 어느 정도인가?
- RQ4온라인 환경에서 인간 사용자가 WhisperLite가 생성한 추천의 관련성을 무작위 기반 모델 대비 어떻게 평가하는가?
- RQ5복잡하고 애매한 사용자 요청에 대해 CLIP 임베딩과 대비 손실을 사용하면 검색 성능이 향상되는가?
주요 결과
- 인간 평가에서 WhisperLite는 랜덤 기반 모델보다 유의미하게 높은 평균 관련성 점수를 기록하였으며, k=3일 때 0.52, k=5일 때 0.72, k=7일 때 0.59를 기록하였고, 이는 랜덤 기반 모델의 약 0.31~0.38 수준보다 뚜렷이 높았다.
- 특히 k=5와 k=7에서 표준편차가 랜덤 기반 모델의 평균보다 낮아, 인간 평가에서 더 일관되고 신뢰할 수 있는 성능을 보였다.
- 실제 데이터셋인 WhisperD에서 WhisperLite는 전체 미세조정 기반 모델인 Whisper를 능가하며, CLIP의 하위 레이어를 동결함으로써 노이즈 유발 특징 학습 악화를 방지함을 시사한다.
- WhisperLite는 다양한 도메인으로의 일반화 능력이 뛰어나, Yelp, Amazon 의류, Amazon 영화와 같은 오픈소스 데이터셋에서도 뛰어난 성능을 기록하였으며, 더 도전적인 WhisperD 데이터셋보다는 Amazon 영화 데이터셋에 가까운 성능을 보였다.
- 이진 교차 엔트로피와 대비 손실을 조합한 복합 손실 함수는 특히 애매하거나 불완전한 사용자 요청을 다룰 때 검색 지표 향상에 효과적이었다.
- 인간 연구를 통해 WhisperLite의 추천 결과는 사용자에게 더 관련성 있고 일관성 있게 인식되었으며, 모든 k값에서 모델 출력 결과에 대한 네트워크 선호도가 무작위 제안보다 높았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.