[논문 리뷰] Contrastive Cross-domain Recommendation in Matching
이 논문은 대규모 추천 시스템의 매칭 단계에서 교차 도메인 추천을 위한 새로운 프레임워크인 대비 교차 도메인 추천(Contrastive Cross-Domain Recommendation, CCDR)을 제안한다. 다양한 선호도 네트워크에 내부 도메인 및 세 가지 유형의 외부 도메인 대비 학습을 도입함으로써, 데이터 희소성과 인기도 편향을 효과적으로 완화하고, WeChat 토픽스토리에서 오프라인 메트릭과 온라인 참여도를 크게 향상시켰으며, 콜드스타트 도메인에서 HIT@500에 대해 14.37%의 상대적 향상을 달성했다.
Cross-domain recommendation (CDR) aims to provide better recommendation results in the target domain with the help of the source domain, which is widely used and explored in real-world systems. However, CDR in the matching (i.e., candidate generation) module struggles with the data sparsity and popularity bias issues in both representation learning and knowledge transfer. In this work, we propose a novel Contrastive Cross-Domain Recommendation (CCDR) framework for CDR in matching. Specifically, we build a huge diversified preference network to capture multiple information reflecting user diverse interests, and design an intra-domain contrastive learning (intra-CL) and three inter-domain contrastive learning (inter-CL) tasks for better representation learning and knowledge transfer. The intra-CL enables more effective and balanced training inside the target domain via a graph augmentation, while the inter-CL builds different types of cross-domain interactions from user, taxonomy, and neighbor aspects. In experiments, CCDR achieves significant improvements on both offline and online evaluations in a real-world system. Currently, we have deployed our CCDR on WeChat Top Stories, affecting plenty of users. The source code is in https://github.com/lqfarmer/CCDR.
연구 동기 및 목표
- 대규모 시스템의 매칭 모듈 내에서 교차 도메인 추천(CDR)의 데이터 희소성과 인기도 편향 문제를 해결하기 위해.
- 특히 콜드스타트 시나리오에서 정렬된 사용자에 대한 의존도를 최소화하면서 소스 도메인에서 타겟 도메인으로 효과적인 지식 전이를 가능하게 하기 위해.
- 추천 시스템의 후보 생성 단계에서 정확도, 다양성, 온라인 효율성을 균형 있게 유지하기 위해.
- 모델 효율성을 해치지 않으면서 표현 학습과 교차 도메인 전이를 향상시키는 대비 학습 메커니즘을 설계하기 위해.
제안 방법
- 사용자, 아이템, 클릭, 공유, 좋아요, 태그니즘의 여섯 가지 유형의 객체를 통합한 글로벌 다양한 선호도 네트워크를 구축하여 다양한 사용자 관심사를 포착한다.
- 이질적 상호작용을 모델링하고 표현 학습을 향상시키기 위해 GNN 기반 집합기에서 이웃 유사도 기반 손실을 적용한다.
- 서브그래프 기반 데이터 증강을 사용하여 내부 도메인 대비 학습(intra-CL)을 도입함으로써 타겟 도메인 내에서 학습의 안정성과 향상을 높인다.
- 사용자 기반, 태그니즘 기반, 이웃 기반의 세 가지 유형의 외부 도메인 대비 학습(inter-CL) 작업을 설계하여 다중 경로 지식 전이를 가능하게 한다.
- intra-CL 및 inter-CL 손실 항목의 가중 조합으로 모델을 최적화하며, 성능 균형을 맞추기 위해 탈락 분석을 통해 초모수를 조정한다.
실험 결과
연구 질문
- RQ1내부 도메인 대비 학습이 타겟 도메인의 매칭 모듈에서 데이터 희소성과 인기도 편향을 효과적으로 완화할 수 있는가?
- RQ2콜드스타트 및 소수 샘플 추천 시나리오에서 지식 전이에 가장 효과적인 외부 도메인 대비 학습 유형은 무엇인가?
- RQ3다양한 대비 학습 구성 요소가 오프라인 및 온라인 평가 환경에서 성능 향상에 기여하는 방식은 무엇인가?
- RQ4제안된 프레임워크는 높은 효율성과 다양성 요구 사항을 충족하는 실세계 구현에서도 강건성과 확장성을 유지할 수 있는가?
주요 결과
- CCDR는 엄격한 콜드스타트 도메인에서 HIT@500에 대해 상대적으로 14.368% 향상된 성과를 기록하여 모든 베이스라인을 압도적으로 능가했다.
- intra-CL과 inter-CL의 조합이 가장 높은 성과 향상을 이끌었으며, 특히 소수 샘플 설정에서 inter-CL가 성능 향상에 가장 기여했다.
- 탈락 분석을 통해 intra-CL과 inter-CL가 모두 필수적임을 확인했으며, 사용자 행동이 더 많은 경우 intra-CL가 더 강한 성과 향상을 보였다.
- 사용자 기반 inter-CL는 소수 샘플 도메인에서 가장 효과적이었고, 태그니즘 기반 inter-CL는 엄격한 콜드스타트 설정에서 더 나은 성능을 보였다.
- 최적의 손실 가중치는 intra-CL에 대해 λ₃ = 1.5, inter-CL에 대해 λ₄ = 0.6였으며, 이 값 이상으로 넘어가면 성능이 최점에 도달한 후 감소했다.
- WeChat 토픽스토리에서의 온라인 A/B 테스트 결과, CCDR은 CTR, CTR, 체류 시간의 세 가지 핵심 지표를 모두 유의미하게 향상시켰으며, p < 0.01의 유의수준을 확보하여 실세계 적용의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.