Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning

Lingzi Zhang, Xin Zhou|arXiv (Cornell University)|2023. 03. 21.
Recommender Systems and Techniques인용 수 7
한 줄 요약

이 논문은 사용자 행동 시계열과 항목의 다중모态 콘텐츠(텍스트 및 이미지)를 정렬하기 위해 대비 학습을 활용하는 순차적 추천을 위한 다중모달 사전학습 프레임워크인 MSM4SR를 제안한다. 시각-언어 모델을 통해 이미지 특징을 텍스트 토큰으로 변환하고, 새로운 다중모달 믹스업 시퀀스 인코더(M2SE)를 사용함으로써 모ality 간 격차와 도메인 갭을 줄이며, 실제 데이터셋에서 순차적, 콜드스타트, 크로스도메인 추천 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Current multimodal sequential recommendation models are often unable to effectively explore and capture correlations among behavior sequences of users and items across different modalities, either neglecting correlations among sequence representations or inadequately capturing associations between multimodal data and sequence data in their representations. To address this problem, we explore multimodal pre-training in the context of sequential recommendation, with the aim of enhancing fusion and utilization of multimodal information. We propose a novel Multimodal Pre-training for Sequential Recommendation (MP4SR) framework, which utilizes contrastive losses to capture the correlation among different modality sequences of users, as well as the correlation among different modality sequences of users and items. MP4SR consists of three key components: 1) multimodal feature extraction, 2) a backbone network, Multimodal Mixup Sequence Encoder (M2SE), and 3) pre-training tasks. After utilizing pre-trained encoders to generate initial multimodal features of items, M2SE adopts a complementary sequence mixup strategy to fuse different modality sequences, and leverages contrastive learning to capture modality interactions at the sequence-to-sequence and sequence-to-item levels. Extensive experiments on four real-world datasets demonstrate that MP4SR outperforms state-of-the-art approaches in both normal and cold-start settings. We further highlight the efficacy of incorporating multimodal pre-training in sequential recommendation representation learning, serving as an effective regularizer and optimizing the parameter space for the recommendation task.

연구 동기 및 목표

  • 풍부한 다중모달 항목 콘텐츠(텍스트 및 이미지)를 활용하여 순차적 추천에서의 데이터 희소성 문제를 해결한다.
  • 다중모달 추천에서 텍스트 및 시각 모달 간의 표현 격차를 줄인다.
  • 통합된 사전학습 프레임워크를 통해 사용자 행동 시계열과 항목의 다중모달 콘텐츠 간의 도메인 갭을 메운다.
  • 혼합된 다중모달 시계열에서의 대비 학습을 통해 순차적 추천 모델의 일반화 능력과 이식 가능성을 향상시킨다.
  • 콜드스타트 및 크로스도메인 추천과 같은 도전적인 상황에서 제안된 프레임워크의 효과성을 입증한다.

제안 방법

  • 시각-언어 사전학습 모델을 사용해 항목 이미지를 텍스트 키워드로 토큰화함으로써 텍스트 기술과의 의미적 정렬을 가능하게 한다.
  • Sentence-BERT를 활용해 이미지 토큰과 항목 기술서에서 초기 텍스트 및 시각 임베딩을 추출함으로써 모달 간 격차를 감소시킨다.
  • 사용자 행동 시계열과 다중모달 항목 특징을 보완적 시퀀스 믹스업 전략을 사용해 융합하는 다중모달 믹스업 시퀀스 인코더(M2SE)를 설계한다.
  • 두 가지 대비 학습 목표를 도입한다: 모달별 다음 항목 예측과 다중모달 간 대비 학습을 통해 모달 간 표현을 정렬한다.
  • 다운스트림 추천 작업에서의 파인튜닝 이전에, 자율적 대비 신호를 사용해 온도가 높은 항목들에서 M2SE를 사전학습한다.
  • Transformer 기반 모델의 가중치를 동결하고, 새로운 도메인 또는 콜드 아이템에 적응할 때만 모달 인코더만 업데이트함으로써 파rameter 효율적인 파인튜닝을 적용한다.

실험 결과

연구 질문

  • RQ1데이터 희소성 상황에서 대비 학습을 활용한 다중모달 사전학습이 순차적 추천 성능을 향상시킬 수 있는가?
  • RQ2제안된 M2SE 모듈이 다중모달 항목 콘텐츠와 순차적 사용자 행동을 얼마나 효과적으로 융합하는가?
  • RQ3대비 학습 목표가 모달 간 격차를 어느 정도 줄이고 표현 일반화를 향상시키는가?
  • RQ4사전학습된 MSM4SR 프레임워크가 콜드스타트 및 크로스도메인 추천 시나리오로 일반화될 수 있는가?
  • RQ5직접적인 이미지 임베딩 방법에 비해 이미지에서 텍스트 토큰을 도출하는 방식이 다중모달 정렬을 향상시키는가?

주요 결과

  • MSM4SR는 세 개의 실제 데이터셋에서 최신 기술 수준의 순차적 추천 모델을 모두 능가하며, 모든 평가 지표에서 최고 성능을 기록했다.
  • 콜드스타트 추천에서 MSM4SR는 최고의 베이스라인 대비 R@10에서 15.5% 향상되고 N@10에서 14.7% 향상되어 낮은 데이터를 가진 항목에 대한 강력한 일반화 능력을 입증했다.
  • 크로스도메인 추천에서 MSM4SR Cross는 팬트리 데이터셋에서 R@10(0.0622)과 N@10(0.0294)을 기록했으며, 아트스 데이터셋에서 R@10(0.1041)을 달성하여 UniSRec과 RecGURU를 모두 능가했다.
  • 제거 실험 결과는 사전학습이 핵심임을 확인했다: 사전학습 없이 학습한 MSM4SR는 전체 모델보다 성능이 열 劣하다. 이는 자율적 사전학습의 가치를 입증한다.
  • 다중모달 간 대비 학습 손실은 표현 정렬을 향상시켜, 도메인 내 및 전이 학습 작업 모두에서 더 나은 성능을 보였다.
  • 이미지에서 유도된 텍스트 토큰의 사용은 직접적인 이미지 인코더보다 더 나은 의미 정렬을 가능하게 하며, 추가적인 프로젝션 헤드 없이도 모달 갭을 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.