Skip to main content
QUICK REVIEW

[논문 리뷰] Latent Structure Mining with Contrastive Modality Fusion for Multimedia Recommendation

Jinghao Zhang, Yanqiao Zhu|arXiv (Cornell University)|2021. 11. 01.
Recommender Systems and Techniques인용 수 7
한 줄 요약

이 논문은 다중모달 특징에서 잠재적인 아이템-아이템 관계를 모odal-aware 그래프 구조 학습을 사용해 추출하고, 대비 학습 목표를 통해 다중모달 융합을 향상시키는 새로운 멀티미디어 추천 프레임워크인 MICRO를 제안한다. 모달별 아이템 관계와 교차 모달 정렬을 함께 최적화함으로써, 세 개의 실세계 데이터셋에서 최신 기법들보다 추천 정확도를 향상시킨다.

ABSTRACT

Recent years have witnessed growing interests in multimedia recommendation, which aims to predict whether a user will interact with an item with multimodal contents. Previous studies focus on modeling user-item interactions with multimodal features included as side information. However, this scheme is not well-designed for multimedia recommendation. Firstly, only collaborative item-item relationships are implicitly modeled through high-order item-user-item co-occurrences. We argue that the latent semantic item-item structures underlying these multimodal contents could be beneficial for learning better item representations and assist the recommender models to comprehensively discover candidate items. Secondly, previous studies disregard the fine-grained multimodal fusion. Although having access to multiple modalities might allow us to capture rich information, we argue that the simple coarse-grained fusion by linear combination or concatenation in previous work is insufficient to fully understand content information and item relationships.To this end, we propose a latent structure MIning with ContRastive mOdality fusion method (MICRO for brevity). To be specific, we devise a novel modality-aware structure learning module, which learns item-item relationships for each modality. Based on the learned modality-aware latent item relationships, we perform graph convolutions that explicitly inject item affinities to modality-aware item representations. Then, we design a novel contrastive method to fuse multimodal features. These enriched item representations can be plugged into existing collaborative filtering methods to make more accurate recommendations. Extensive experiments on real-world datasets demonstrate the superiority of our method over state-of-the-art baselines.

연구 동기 및 목표

  • 기존 멀티미디어 추천 방법이 다중모달 아이템 특징 내 잠재적 의미적 구조를 충분히 활용하지 못하는 한계를 해결하기 위해.
  • 다중모달 정보를 융합하는 데 있어 단순한 선형 또는 연결 기반 융합의 부족함을 극복하기 위해.
  • 각 모달 내에서 아이템-아이템 관계를 명시적으로 모델링하여 아이템 표현을 풍부하게 하기 위해.
  • 모달별 표현과 그 다중모달 융합 표현 간의 정렬을 통해 더 세밀한 융합을 가능하게 하는 대비 학습 프레임워크를 개발하기 위해.
  • 향상된 아이템 표현을 협업 필터링 모델에 통합하여 추천 성능을 향상시키기 위해.

제안 방법

  • 모든 모달에 대해 쌍별 유사도를 거리 측정으로 모델링함으로써, 각 모달의 아이템-아이템 관계를 학습하는 모달 인식 구조 학습 모듈을 도입한다.
  • 그래프 컬러리션 네트워크를 적용하여 학습된 모달 인식 아이템 유사도를 모달별 아이템 표현에 통합한다.
  • 각 아이템의 모달 인식 표현과 다중모달 융합 표현 간의 정렬을 위한 대비 학습 프레임워크를 설계한다.
  • 대비 목표는 개별 모달 표현과 최종 다중모달 융합 표현 간의 일치를 최대화하여 강력하고 구분력 있는 임베딩을 촉진한다.
  • 강화된 아이템 표현을 협업 필터링 모델에 통합하여 추천 성능을 향상시킨다.
  • 구조 학습, 대비 학습, 협업 필터링을 결합한 공동 목표를 사용하여 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1다중모달 특징에서 유도된 잠재적 아이템-아이템 관계가 멀티미디어 추천에서 아이템 표현 학습에 기여하는가?
  • RQ2모달별 표현과 다중모달 융합 표현 간의 정렬을 수행하는 대비 학습 프레임워크가 다중모달 정보 융합을 향상시키는가?
  • RQ3모달 인식 구조 학습이 서로 다른 모달 간 아이템 간 의미적 관계를 얼마나 잘 포착하는가?
  • RQ4제안된 방법이 기존 최신 기법들보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5각 구성 요소(구조 학습 및 대비 융합)가 전체 추천 성능에 기여하는 정도는 어떠한가?

주요 결과

  • MICRO는 세 개의 실세계 멀티미디어 추천 데이터셋에서 최신 기법들을 능가하는 최상의 성능을 달성하며, 랭킹 및 정확도 지표 모두에서 승리한다.
  • 제거 실험을 통해 모달 인식 구조 학습과 대비 융합 프레임워크 모두가 추천 성능 향상에 상당한 기여를 한다고 확인된다.
  • 다양한 평가 지표에서 일관된 성능 향상을 보이며, 강건성과 일반화 능력을 입증한다.
  • 대비 학습 구성 요소는 모달별 표현과 다중모달 융합 표현 간의 정렬을 효과적으로 수행하여 특징 품질을 향상시킨다.
  • 학습된 아이템 관계 통합은 더 정확하고 의미적으로 더 풍부한 아이템 임베딩을 생성한다.
  • богат한 다중모달 콘텐츠와 구조적 관계를 활용하여 냉시작 아이템 처리에 매우 효과적임을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.