[논문 리뷰] Latent Structures Mining with Contrastive Modality Fusion for Multimedia Recommendation.
이 논문은 다중모态 콘텐츠와 아이템 간 관계를 보다 잘 모델링하기 위해 모달리티별 잠재적인 아이템-아이템 구조를 탐색하고, 대비 기반 모달리티 융합을 통해 아이템 표현 학습을 향상시키는 새로운 다중모달 추천 프레임워크 MICRO를 제안한다. 모달리티 인식 그래프 컨볼루션과 대비 특징 융합을 통합함으로써 MICRO는 실제 데이터셋에서 최신 기법들을 능가하며, 다중모달 콘텐츠와 아이템 간 관계를 보다 잘 모델링함으로써 추천 정확도를 향상시킨다.
Recent years have witnessed growing interests in multimedia recommendation, which aims to predict whether a user will interact with an item with multimodal contents. Previous studies focus on modeling user-item interactions with multimodal features included as side information. However, this scheme is not well-designed for multimedia recommendation. Firstly, only collaborative item-item relationships are implicitly modeled through high-order item-user-item co-occurrences. We argue that the latent semantic item-item structures underlying these multimodal contents could be beneficial for learning better item representations and assist the recommender models to comprehensively discover candidate items. Secondly, previous studies disregard the fine-grained multimodal fusion. Although having access to multiple modalities might allow us to capture rich information, we argue that the simple coarse-grained fusion by linear combination or concatenation in previous work is insufficient to fully understand content information and item relationships.To this end, we propose a latent structure MIning with ContRastive mOdality fusion method (MICRO for brevity). To be specific, we devise a novel modality-aware structure learning module, which learns item-item relationships for each modality. Based on the learned modality-aware latent item relationships, we perform graph convolutions that explicitly inject item affinities to modality-aware item representations. Then, we design a novel contrastive method to fuse multimodal features. These enriched item representations can be plugged into existing collaborative filtering methods to make more accurate recommendations. Extensive experiments on real-world datasets demonstrate the superiority of our method over state-of-the-art baselines.
연구 동기 및 목표
- 기존 다중모달 추천 기법이 개별 모달리티 내에서 잠재적인 의미론적 아이템-아이템 관계를 명시적으로 모델링하지 못하는 한계를 해결하기 위해.
- 예를 들어 연결 또는 선형 조합과 같은 굵은 흐름의 다중모달 융합 방식이 모달리티 간의 세밀한 상호작용을 포착하지 못하는 부족함을 극복하기 위해.
- 그래프 컨볼루션 네트워크를 통해 모달리티 인식 아이템 유사도를 통합함으로써 아이템 표현 학습을 향상시키기 위해.
- 구분 가능한 의미 정보를 유지하는 대비 학습 전략을 사용하여 다중모달 특징 융합을 향상시키기 위해.
- 기존 협업 필터링 모델과 호환되는 플러그 앤 플레이 모듈을 개발하여 추천 성능을 향상시키기 위해.
제안 방법
- 각 모달리티에 대해 학습된 어텐션 또는 유사도 행렬을 사용하여 아이템-아이템 관계를 명시적으로 모델링하는 모달리티 인식 구조 학습 모듈을 제안한다.
- 모달리티별 아이템 유사도 그래프에 그래프 컨볼루션 네트워크(GCNs)를 적용하여 잠재적인 아이템 유사도를 통합함으로써 아이템 표현을 개선한다.
- 동일한 아이템 간의 양성 샘플 쌍을 정렬하고, 다른 아이템 간의 음성 샘플 쌍을 분리함으로써 특징의 구분 능력을 향상시키는 대비 학습 기반 융합 메커니즘을 설계한다.
- 모달리티별 표현이 동일한 아이템에 대해 더 유사하고, 다른 아이템에 대해 더 이질적이게 만들도록 대비 손실 함수를 사용한다.
- 강화된 다중모달 표현을 표준 협업 필터링 프레임워크에 통합하여 엔드 투 엔드 추천 학습을 수행한다.
- 각 모달리티가 융합 이전에 별도로 처리되는 이중 스트림 아키텍처를 사용하여 모달리티별 구조 탐색과 공동 표현 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1모달리티별 잠재적인 아이템-아이템 관계를 모델링하면 다중모달 추천에서 아이템 표현 학습이 향상되는가?
- RQ2기존의 연결 또는 선형 융합 방식과 비교해 대비 융합이 더 나은 표현 품질을 제공하는가?
- RQ3모달리티 인식 그래프 컨볼루션의 통합은 기준 협업 필터링 대비 추천 성능에 어떤 영향을 미치는가?
- RQ4실제 데이터셋에서 제안된 방법이 최신 기법들을 얼마나 뛰어나게 성능을 발휘하는가?
- RQ5제안된 프레임워크는 아키텍처의 대대적 개편 없이 기존 협업 필터링 모델에 효과적으로 통합될 수 있는가?
주요 결과
- MICRO는 다양한 실세계 다중모달 추천 데이터셋에서 최신 기준 기법들을 능가하는 뛰어난 성능을 기록한다.
- 제거 실험을 통해 모달리티 인식 구조 학습과 대비 융합이 성능 향상에 기여한다는 것이 확인된다.
- 모달리티별 그래프 컨볼루션을 통해 세밀한 아이템 관계를 포착함으로써 표현 품질이 향상됨을 보여준다.
- 대비 융합은 더 구분 가능한 다중모달 임베딩을 생성하여 유사한 아이템을 구분하는 능력을 향상시킨다.
- 다양한 평가 지표인 Recall, NDCG, Precision 에서 다수의 데이터셋에 걸쳐 일관된 성능 향상을 보인다.
- 플러그 앤 플레이 설계 덕분에 MICRO는 기존 협업 필터링 모델에 측정 가능한 성능 향상으로 함께 통합될 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.