[논문 리뷰] Cross-Domain Recommendation for Cold-Start Users via Neighborhood Based Feature Mapping
이 논문은 타겟 도메인에서 평가 기록이 없는 냉시작 사용자를 대상으로 하는 교차 도메인 추천을 위한 새로운 모델인 Cross-Domain Latent Feature Mapping (CDLFM)을 제안한다. 먼저 Matrix Factorization with User Similarities (MFUS)를 사용해 희소 도메인에서 사용자 표현을 향상시키고, 보조 도메인의 유사 사용자들로부터 이웃 기반의 기울기 부스팅 트리(mapping function)를 학습하여 타겟 도메인의 선호도를 예측한다. 이는 실제 Amazon 데이터셋에서 최신 기술들을 능가한다.
Collaborative Filtering (CF) is a widely adopted technique in recommender systems. Traditional CF models mainly focus on predicting a user's preference to the items in a single domain such as the movie domain or the music domain. A major challenge for such models is the data sparsity problem, and especially, CF cannot make accurate predictions for the cold-start users who have no ratings at all. Although Cross-Domain Collaborative Filtering (CDCF) is proposed for effectively transferring users' rating preference across different domains, it is still difficult for existing CDCF models to tackle the cold-start users in the target domain due to the extreme data sparsity. In this paper, we propose a Cross-Domain Latent Feature Mapping (CDLFM) model for cold-start users in the target domain. Firstly, in order to better characterize users in sparse domains, we take the users' similarity relationship on rating behaviors into consideration and propose the Matrix Factorization by incorporating User Similarities (MFUS) in which three similarity measures are proposed. Next, to perform knowledge transfer across domains, we propose a neighborhood based gradient boosting trees method to learn the cross-domain user latent feature mapping function. For each cold-start user, we learn his/her feature mapping function based on the latent feature pairs of those linked users who have similar rating behaviors with the cold-start user in the auxiliary domain. And the preference of the cold-start user in the target domain can be predicted based on the mapping function and his/her latent features in the auxiliary domain. Experimental results on two real data sets extracted from Amazon transaction data demonstrate the superiority of our proposed model against other state-of-the-art methods.
연구 동기 및 목표
- 타겟 도메인에서 이전 평가 기록이 없는 냉시작 사용자에게 추천하는 데 도전하는 것.
- 관측된 평가 외의 사용자 유사성 관계를 통합하여 희소 도메인에서 사용자 표현을 향상시키는 것.
- 개인화된 이웃 기반 특징 매핑 함수를 사용해 보조 도메인에서 타겟 도메인으로 효과적인 지식 전이를 가능하게 하는 것.
- 냉시작 사용자 추천의 정확도에서 기존의 교차 도메인 협업 필터링 방법들을 능가하는 것.
제안 방법
- 세 가지 사용자 유사성 측정 기준—공통 평가, 평가 패턴, 평가 편향—을 행렬 분해 프레임워크에 통합한 Matrix Factorization with User Similarities (MFUS)를 제안한다.
- 잠재 특징 간의 고차원 비선형 매핑 함수를 학습하기 위해 기울기 부스팅 트리(GBT)를 사용한다. 이는 보조 도메인의 잠재 특징에서 타겟 도메인의 예측 잠재 특징으로의 매핑을 가능하게 한다.
- 각 냉시작 사용자에 대해 유사한 평가 행동을 보이는 보조 도메인 내 연결된 사용자 이웃을 식별하여 매핑 함수를 개인화한다.
- 세 가지 유사성 측정 기준(ρ₁, ρ₂, ρ₃)의 가중 조합을 사용해 MFUS에서 다양한 행동 패턴의 영향력을 동적으로 조정한다.
- MFUS 파라미터의 효율적 최적화를 위해 백트래킹 선 탐색을 적용하며, 하이퍼파라미터 γ₁, γ₂, γ₃, σ 및 ρ₁, ρ₂, ρ₃는 격자 탐색을 통해 튜닝된다.
- 이웃 크기를 제어하기 위해 유사도 임계값(sim)을 사용하여, 충분히 유사한 사용자들만 매핑 함수에 기여하도록 한다.
실험 결과
연구 질문
- RQ1행렬 분해에 사용자 유사성 관계를 통합하면 희소 도메인에서 잠재 특징 표현이 향상되는가?
- RQ2평가 기록이 없는 냉시작 타겟 도메인으로 보조 도메인에서 효과적인 지식 전이를 어떻게 달성할 수 있는가?
- RQ3이웃 기반 기울기 부스팅 트리 접근 방식이 교차 도메인 특징 변환에 있어 전역 매핑 함수보다 더 효과적인가?
- RQ4사용자 행동 모델링을 위한 세 가지 유사성 측정 기준 간의 최적의 균형은 무엇인가?
- RQ5모델 성능은 유사도 임계값과 이웃 크기의 선택에 얼마나 민감한가?
주요 결과
- CDLFM는 실제 Amazon 데이터셋 두 개에서 모두 가장 낮은 MAE와 RMSE를 기록하며, MF+GBT와 TMatrix를 능가하여 냉시작 교차 도메인 추천에서의 우수성을 입증한다.
- MFUS에서 β > 0일 때 표준 MF보다 항상 성능 향상을 보이며, 사용자 유사성 통합이 단일 도메인 평가 예측을 향상시킨다는 것을 보여준다.
- MFUS에서 최적 성능은 β = 0.005 및 K = 20에서 달성되며, 더 높은 K 또는 β 값에서는 과적합으로 인해 성능이 저하된다.
- 최적의 유사성 가중치 조합(ρ₁=0.6, ρ₂=0.2, ρ₃=0.2)이 가장 낮은 RMSE(1.027)와 MAE(0.766)를 기록하여 세 가지 유사성 측정 기준의 모두 가치가 있음을 확인한다.
- 유사도 임계값(sim)을 높일수록 모델 성능이 향상되며, sim=0.5에서 성능이 평준화되는 것은 이웃 수의 부족 때문이며, 이는 이웃 품질이 핵심임을 시사한다.
- 이웃 기반 GBT 매핑 함수는 전역 매핑 함수보다 뚜렷이 뛰어나며, 개인화된 행동 기반 전이가 일반 모델보다 더 효과적임을 증명한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.