Skip to main content
QUICK REVIEW

[논문 리뷰] Large Multi-modal Encoders for Recommendation

Zixuan Yi, Zijun Long|arXiv (Cornell University)|2023. 10. 31.
Recommender Systems and Techniques인용 수 4
한 줄 요약

이 논문은 대규모 다중모달(LMM) 인코더—CLIP 및 VLMo—를 다중모달 추천 시스템에 통합하는 것을 조사하며, 사전 훈련된 및 미세조정된 LMM 인코더가 더 깊은 다중모달 정렬을 가능하게 하여 사용자 및 아이템 표현 학습을 크게 향상시킴을 보여준다. 연구는 엔드 투 엔드 훈련이 특히 이중스트림 인코더인 CLIP와 함께 성능을 더욱 향상시켜 세 개의 다중모달 추천 데이터셋에서 최신 기술 수준의 성능을 달성함을 보여준다.

ABSTRACT

In recent years, the rapid growth of online multimedia services, such as e-commerce platforms, has necessitated the development of personalised recommendation approaches that can encode diverse content about each item. Indeed, modern multi-modal recommender systems exploit diverse features obtained from raw images and item descriptions to enhance the recommendation performance. However, the existing multi-modal recommenders primarily depend on the features extracted individually from different media through pre-trained modality-specific encoders, and exhibit only shallow alignments between different modalities - limiting these systems' ability to capture the underlying relationships between the modalities. In this paper, we investigate the usage of large multi-modal encoders within the specific context of recommender systems, as these have previously demonstrated state-of-the-art effectiveness when ranking items across various domains. Specifically, we tailor two state-of-the-art multi-modal encoders (CLIP and VLMo) for recommendation tasks using a range of strategies, including the exploration of pre-trained and fine-tuned encoders, as well as the assessment of the end-to-end training of these encoders. We demonstrate that pre-trained large multi-modal encoders can generate more aligned and effective user/item representations compared to existing modality-specific encoders across three multi-modal recommendation datasets. Furthermore, we show that fine-tuning these large multi-modal encoders with recommendation datasets leads to an enhanced recommendation performance. In terms of different training paradigms, our experiments highlight the essential role of the end-to-end training of large multi-modal encoders in multi-modal recommendation systems.

연구 동기 및 목표

  • 기존의 다중모달 추천 시스템에서 모ality별 인코더에 의존하는 바탕으로 얕은 다중모달 정렬의 한계를 해결하기 위해.
  • CLIP 및 VLMo와 같은 대규모 다중모달 인코더(LMM)가 다중모달 환경에서 표현 학습과 추천 성능 향상에 기여할 수 있는지 조사하기 위해.
  • 추천 모델 내에서 LMM 인코더에 적용된 다양한 훈련 파라다임—사전 훈련, 미세조정, 엔드 투 엔드 훈련—의 효과성을 비교하기 위해.
  • LMM 인코더가 강화된 시각적 및 텍스처적 모달이 다중모달 추천에서 기여하는 바를 분석하기 위해.
  • LATTICE와 같은 기존 추천 모델과 LMM 인코더 간의 아키텍처적 및 훈련 관련 갈등을 특정하고, 이들이 성능에 미치는 영향을 규명하기 위해.

제안 방법

  • 연구는 다섯 개의 기존 다중모달 추천 모델—MMGCL, LATTICE 및 기타 세 개—에 최신 기술 수준의 LMM 인코더 두 종류인 CLIP(이중스트림)와 VLMo(통합형)를 통합한다.
  • 사전 훈련된 CLIP 및 VLMo 인코더를 특징 추출기로 사용하며, 각 데이터셋의 아이템 이미지 및 텍스트 데이터에 대해 추천 작업에 맞게 인코더를 미세조정한다.
  • 세 가지 훈련 파라다임을 평가한다: (1) 사전 훈련된 인코더만 사용, (2) 추천 데이터에 대해 인코더를 미세조정, (3) LMM 인코더를 포함한 전체 모델을 엔드 투 엔드로 훈련.
  • CLIP 및 VLMo에 내장된 대비 학습 목표를 통해 다중모달 정렬을 향상시키며, 이는 시각적 및 텍스처적 특징을 공유 공간에 함께 임bedding하는 데 기여한다.
  • 세 개의 다중모달 추천 데이터셋—Amazon Sports, Amazon Clothing, Amazon Baby—에서 표준 평가 지표(NDCG@20 및 Recall@K)를 사용해 성능을 평가한다.
  • 모달 기여 분석을 수행하여, 시각적 모달, 텍스처적 모달, 또는 둘 다를 입력으로 사용했을 때, LMM 인코더 유무에 따라 성능를 비교한다.

실험 결과

연구 질문

  • RQ1RQ1: 사전 훈련된 대규모 다중모달 인코더(CLIP 및 VLMo)가 모달별 인코더에 비해 다중모달 추천 모델의 성능을 향상시킬 수 있는가?
  • RQ2RQ2: 추천 데이터셋에 대해 LMM 인코더를 미세조정하면 추천 성능에 어떤 영향을 미치는가?
  • RQ3RQ3: 두 단계(사전 훈련 + 미세조정)와 엔드 투 엔드 훈련 간의 다른 훈련 파라다임이 LMM 인코더의 효과성에 어떤 영향을 미치는가?
  • RQ4RQ4: LMM 인코더는 다중모달 추천에서 개별 모달(시각적 및 텍스처적)의 기여도를 어느 정도 향상시키는가?
  • RQ5RQ5: LATTICE와 같은 특정 추천 모델과 LMM 인코더 간에 아키텍처적 갈등이 존재하는가, 그리고 이는 성능에 어떤 영향을 미치는가?

주요 결과

  • 사전 훈련된 CLIP 및 VLMo 인코더는 120개의 테스트 케이스 중 79%에서 모달별 인코더보다 추천 성능을 향상시켰으며, 이는 다중모달 정렬과 표현 품질 향상의 상당한 성과를 보여준다.
  • 추천 데이터셋에 대해 LMM 인코더를 미세조정함으로써 성능 향상이 추가로 발생했으며, 도메인 특화 적응의 유용성을 확인한다.
  • CLIP(이중스트림 인코더)의 엔드 투 엔드 훈련은 모든 모델에서 성능을 크게 향상시켰으며, 특히 LATTICE와 같은 모델과의 개념적 갈등을 해결하는 데 기여했다.
  • 반면, VLMo(통합형 인코더)는 엔드 투 엔드 훈련으로 인해 동일한 성능 향상을 보이지 않아, 아키텍처의 차이가 훈련 동역학에 영향을 미칠 수 있음을 시사한다.
  • 시각적 및 텍스처적 모달을 모두 사용할 경우 LMM 인코더 통합이 일관되게 성능 향상시켰으며, 모든 데이터셋에서 NDCG@20 점수에서 통계적으로 유의미한 향상(p < 0.05)을 관찰했다.
  • 모달 기여 분석을 통해 LMM 인코더가 더 깊은 정렬을 가능하게 하여, 단일 모달 입력보다 다중모달 융합이 훨씬 효과적임을 확인했으며, 기준 모델이 융합 특징을 사용할 때 성능이 떨어지는 경우에도 마찬가지로 성능 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.