[논문 리뷰] Knowledge-aware Neural Collective Matrix Factorization for Cross-domain Recommendation
이 논문은 지식 그래프(KGs)를 통합하여 도메인 간 추천 성능을 향상시키기 위해 지식을 고려하는 신경 집합 행렬 분해(KG-NeuCMF) 프레임워크를 제안한다. 이는 KG 구조화된 지식으로부터 도메인 특화 및 도메인 일반 항목 표현을 동시에 학습함으로써 이루어진다. 그래프 오토에코더와 사용자-항목 상호작용 및 KG 임베딩 간 상호정보를 최대화하는 방식을 활용하여, 기존 최고 수준의 베이스라인 대비 상대적 개선률 최대 21%를 기록하며 냉각기 및 희소 상황에서 MAE 성능을 크게 향상시킨다.
Cross-domain recommendation (CDR) can help customers find more satisfying items in different domains. Existing CDR models mainly use common users or mapping functions as bridges between domains but have very limited exploration in fully utilizing extra knowledge across domains. In this paper, we propose to incorporate the knowledge graph (KG) for CDR, which enables items in different domains to share knowledge. To this end, we first construct a new dataset AmazonKG4CDR from the Freebase KG and a subset (two domain pairs: movies-music, movie-book) of Amazon Review Data. This new dataset facilitates linking knowledge to bridge within- and cross-domain items for CDR. Then we propose a new framework, KG-aware Neural Collective Matrix Factorization (KG-NeuCMF), leveraging KG to enrich item representations. It first learns item embeddings by graph convolutional autoencoder to capture both domain-specific and domain-general knowledge from adjacent and higher-order neighbours in the KG. Then, we maximize the mutual information between item embeddings learned from the KG and user-item matrix to establish cross-domain relationships for better CDR. Finally, we conduct extensive experiments on the newly constructed dataset and demonstrate that our model significantly outperforms the best-performing baselines.
연구 동기 및 목표
- 공통 사용자 또는 매핑 함수에만 의존하는 기존 도메인 간 추천(CDR) 모델의 한계를 해결하기 위해, 서로 다른 도메인 간 항목 간 풍부한 의미적 관계를 활용하지 못하는 문제를 해결한다.
- 이중 방향 CDR에서의 부정적 전이 문제를 해결하기 위해 지식 그래프(KGs)를 자연스러운 다리로 활용하여 도메인 일반 및 도메인 특화 지식을 공유한다.
- 사용자-항목 상호작용 행렬에서 학습한 항목 표현과 지식 그래프에서 유도된 표현을 통합하여 도메인 간 추천 성능을 향상시키는 통합 프레임워크를 개발한다.
- 재현 가능한 연구를 가능하게 하기 위해, 새로운 공개 벤치마크 데이터셋인 AmazonKG4CDR를 구축한다.
- 사용자 상호작용 데이터가 제한된 경우에도 유의미한 정보를 제공하는 KG 기반 항목 표현을 활용하여 냉각기 및 데이터 희소 상황에서의 성능을 향상시킨다.
제안 방법
- Freebase KG를 Amazon 리뷰 데이터의 두 도메인 쌍(영화-음악, 영화-책)과 통합하여 AmazonKG4CDR 데이터셋을 구축함으로써, 공통 엔티티와 관계를 통해 도메인 간 항목 연결을 가능하게 한다.
- 관계형 그래프 컨volution 오토에코더(RGCN 기반)를 활용하여 KG에서 항목 임베딩을 학습함으로써, 다양한 도메인 간 인접 및 고차원 이웃 정보를 모두 포괄한다.
- 사용자-항목 상호작용 행렬에서 유도된 항목 임베딩과 KG에서 유도된 임베딩 간 상관관계를 최대화하기 위해 신경 상호정보 추정기를 도입함으로써 효과적인 도메인 간 정렬을 보장한다.
- 신경 집합 행렬 분해(신경CMF) 프레임워크를 통해 학습된 KG 기반 항목 표현과 사용자-항목 상호작용 임베딩을 통합하여 종단 간 추천을 수행한다.
- 대규모 지식 그래프에서 노이즈가 존재하는 상황에서도 강건성과 일반화 능력을 향상시키기 위해, KG 임베딩 학습 과정에서 대비 학습 원리를 적용한다.
- 두 단계 학습 프로세스를 적용한다: 먼저 그래프 오토에코딩을 통해 KG 임베딩을 사전 학습하고, 이후 상호정보 정규화 목표함수 하에 사용자-항목 상호작용 데이터와 함께 공동 미세조정한다.
실험 결과
연구 질문
- RQ1공통 의미 지식을 통해 서로 다른 도메인 간 항목을 연결함으로써, 지식 그래프가 도메인 간 추천을 향상시키는 데 효과적인 다리 역할을 할 수 있는가?
- RQ2사용자-항목 상호작용과 지식 그래프에서 동시에 항목 표현을 학습함으로써 도메인 특화 및 도메인 일반 지식을 포괄할 수 있는가?
- RQ3지식 그래프에서 유도된 고차원 이웃 정보 통합이 희소 또는 냉각기 상황에서 추천 성능에 어떤 영향을 미치는가?
- RQ4사용자-항목 상호작용 임베딩과 KG 기반 항목 임베딩 간 상호정보 최대화가 도메인 간 전이 학습을 어떻게 향상시키는가?
- RQ5기존의 사용자 겹침 또는 임베딩 매핑 함수에만 의존하는 CDR 모델 대비, 지식 그래프 인식 프레임워크는 어느 정도 성능을 뛰어넘는가?
주요 결과
- 제안된 KG-NeuCMF 모델은 영화-음악 도메인 간 추천 과제에서 가장 강력한 베이스라인 대비 MAE에서 상대적 개선률 21%를 기록하며 뚜렷한 성능 향상을 입증한다.
- 영화-책 과제에서는 가장 강력한 베이스라인 대비 MAE를 15.18% 감소시켜, 다양한 도메인을 포함한 도메인 간 설정에서의 효과성을 입증한다.
- 영화-책 과제에서 F1_score는 90.80 ± 0.22로 기록되어, 최고 수준의 CDR 모델인 DDTCDR 및 CoNet을 포함한 모든 베이스라인을 압도한다.
- 제거 분석 결과, KG 임베딩과 사용자-항목 임베딩 간 상호정보 기반 정렬 전략이 간단한 연결 또는 MLP를 통한 정제 전략보다 뛰어난 성능을 기록함을 확인하였다.
- 냉각기 상황에서는 NCF 및 CMF 대비 KG 기반 표현을 활용하여 신규 항목에 대해 성능 저하를 크게 줄여, 데이터 희소성에 의한 영향을 완화함을 입증하였다.
- 음악과 같이 희소한 도메인에서는 KG 통합이 더 밀도 높은 도메인보다 데이터 희소성 문제를 더 효과적으로 완화함을 확인하여, 낮은 데이터 환경에서 KG의 가치를 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.