Skip to main content
QUICK REVIEW

[논문 리뷰] Bootstrap Latent Representations for Multi-modal Recommendation

Xin Zhou, Hongyu Zhou|arXiv (Cornell University)|2022. 07. 13.
Topic Modeling인용 수 11
한 줄 요약

이 논문은 잠재 표현 드롭아웃을 통한 대조적 시각 부트스트래핑을 통해 음성 샘플링과 보조 그래프가 필요 없이 자기지도 학습 다중모달 추천 모델인 BM3을 제안한다. 상호작용 그래프 복원, 다중모달 간 정렬, 내모달 특징 마스킹을 공동 최적화함으로써 20,000~200,000 노드를 가진 데이터셋에서 SOTA 정확도를 달성하면서도 학습 속도가 2~9배 빠르다.

ABSTRACT

This paper studies the multi-modal recommendation problem, where the item multi-modality information (e.g., images and textual descriptions) is exploited to improve the recommendation accuracy. Besides the user-item interaction graph, existing state-of-the-art methods usually use auxiliary graphs (e.g., user-user or item-item relation graph) to augment the learned representations of users and/or items. These representations are often propagated and aggregated on auxiliary graphs using graph convolutional networks, which can be prohibitively expensive in computation and memory, especially for large graphs. Moreover, existing multi-modal recommendation methods usually leverage randomly sampled negative examples in Bayesian Personalized Ranking (BPR) loss to guide the learning of user/item representations, which increases the computational cost on large graphs and may also bring noisy supervision signals into the training process. To tackle the above issues, we propose a novel self-supervised multi-modal recommendation model, dubbed BM3, which requires neither augmentations from auxiliary graphs nor negative samples. Specifically, BM3 first bootstraps latent contrastive views from the representations of users and items with a simple dropout augmentation. It then jointly optimizes three multi-modal objectives to learn the representations of users and items by reconstructing the user-item interaction graph and aligning modality features under both inter- and intra-modality perspectives. BM3 alleviates both the need for contrasting with negative examples and the complex graph augmentation from an additional target network for contrastive view generation. We show BM3 outperforms prior recommendation models on three datasets with number of nodes ranging from 20K to 200K, while achieving a 2-9X reduction in training time. Our code is available at https://github.com/enoche/BM3.

연구 동기 및 목표

  • 대규모 사용자-아이템 상호작용 그래프에서 베이지안 개인화 순위(BPR) 손실에 대한 음성 샘플링의 높은 계산 비용 문제를 해결하기 위해.
  • 기존 GNN 기반 다중모달 추천 방법에서 사용되는 보조 그래프(예: 사용자-사용자 또는 아이템-아이템)로 인한 메모리 및 계산 오버헤드를 줄이기 위해.
  • 추가 네트워크 없이 잠재 표현에서 대조적 시각을 생성함으로써 지나친 해법과 노이즈가 많은 지도 신호를 피하는 자기지도 프레임워크를 개발하기 위해.
  • 통합된 목표 함수를 통해 다중모달 정렬과 상호작용 그래프 복원을 공동 최적화하여 표현 학습을 향상시키기 위해.
  • 대규모 다중모달 데이터셋에서 학습 시간을 크게 줄이며 동시에 최고의 추천 정확도를 달성하기 위해.

제안 방법

  • 잠재 표현 드롭아웃을 적용하여 사용자 및 아이템의 잠재 표현에 무작위 드롭아웃을 적용함으로써 대조적 시각을 부트스트래핑한다. 이는 복잡한 데이터 증강 또는 타겟 네트워크가 필요 없도록 한다.
  • 다중모달 대조 손실을 도입하여 다음과 같은 세 가지를 동시에 최소화한다: (1) 사용자-아이템 상호작용 그래프 복원 손실, (2) 아이템 ID 잠재 표현과 다중모달 특징 간의 다중모달 간 정렬 손실, (3) 모달 특성 전용의 내모달 특징 마스킹 손실.
  • 모델은 그래프 신경망(GNN) 기반 아키텍처를 사용하여 표현을 전파하고 집계하며, 대조적 시각 생성은 오직 드롭아웃을 통한 잠재 공간의 변형에 의존한다.
  • 음성 샘플링을 피하기 위해 양성 샘플만을 사용하는 대조 학습에 기반하며, 대조 신호는 동일 샘플의 변형된 시각에서 유도된다.
  • 정규화 계수와 드롭아웃 비율은 다양한 데이터셋 간 표현 안정성과 성능의 균형을 이루기 위해 조정되는 하이퍼파라미터이다.
  • 본 방법은 전형적인 세 가지 실세계 데이터셋에서 종합적으로 평가되었으며, 최대 200,000개의 노드를 가진 대규모 전자제품 데이터셋도 포함되어 있다.

실험 결과

연구 질문

  • RQ1자기지도 학습 다중모달 추천 모델이 BPR 손실에서 음성 샘플링이 필요 없이도 추천 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ2보조 네트워크나 복잡한 데이터 증강 없이도 잠재 표현에서 효과적으로 대조적 시각을 생성할 수 있는가?
  • RQ3상호작용 그래프 복원, 다중모달 간 정렬, 내모달 마스킹을 공동 최적화함으로써 다중모달 추천에서 표현 학습이 향상되는가?
  • RQ4다양한 크기의 데이터셋에서 제안된 방법의 성능 스케일링은 어떻게 되는가? 특히 대규모 그래프에서의 성능은 어떻게 되는가?
  • RQ5다양한 손실 구성 요소가 모델 성능에 미치는 영향은 무엇이며, 소규모 및 대규모 데이터셋 간에 그 영향은 어떻게 다를까?

주요 결과

  • BM3는 최대 200,000개의 노드를 가진 대규모 전자제품 데이터셋을 포함한 세 개의 실세계 데이터셋에서 SOTA 성능을 달성한다.
  • 기존 기준 모델 대비 학습 시간을 2~9배 단축시켜 대규모 그래프에서 뚜렷한 효율성 향상을 보였다.
  • 전자제품 데이터셋에서 BM3는 명시적인 다중모달 신호 없이도 기존 방법을 능가하는 성능을 보였으며, 자기지도 목표 함수로부터 강력한 표현 학습이 가능하다는 것을 시사한다.
  • 제거 실험 결과, 소규모 데이터셋에서는 다중모달 간 정렬 손실과 내모달 마스킹 손실이 성능 향상에 핵심적인 역할을 하지만, 대규모 데이터셋에서는 감독 신호가 지배적이므로 그 기여도가 감소함을 확인하였다.
  • 모델은 하이퍼파라미터 설정에 대해 뛰어난 내성성을 보였으며, 드롭아웃 비율 0.2 이상 및 다양한 정규화 계수 설정에서도 안정적인 성능을 유지하였고, 특히 대규모 데이터에서 두드러진다.
  • 다중모달 신호 없이도 BM3(w/o mm)의 성능은 전자제품 데이터셋에서 이미 경쟁력 있는 성능을 보였으며, 자기지도 신호만으로도 강력한 표현을 도출할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.