Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangled Multimodal Representation Learning for Recommendation

Fan Liu, Huilin Chen|arXiv (Cornell University)|2022. 03. 10.
Recommender Systems and Techniques인용 수 8
한 줄 요약

이 논문은 다중모态(예: 텍스트, 이미지) 간의 항목 요소를 분리하고 사용자별로 모달리티 선호도를 모델링하는 데 중점을 두어, 인지 가능한 요소 수준에서 개인화된 모달리티 기여도를 효과적으로 포착하는 새로운 추천 모델인 분리 다중모달 표현 학습(Disentangled Multimodal Representation Learning, DMRL)을 제안한다. 다섯 개인 실세계 데이터셋에서의 실험 결과, 기존 최고 수준의 방법들을 뛰어넘는 성능을 보이며, 사용자 선호도에 대한 요소 수준의 개인화된 모달리티 기여도를 효과적으로 포착함을 입증한다.

ABSTRACT

Many multimodal recommender systems have been proposed to exploit the rich side information associated with users or items (e.g., user reviews and item images) for learning better user and item representations to improve the recommendation performance. Studies from psychology show that users have individual differences in the utilization of various modalities for organizing information. Therefore, for a certain factor of an item (such as appearance or quality), the features of different modalities are of varying importance to a user. However, existing methods ignore the fact that different modalities contribute differently towards a user's preference on various factors of an item. In light of this, in this paper, we propose a novel Disentangled Multimodal Representation Learning (DMRL) recommendation model, which can capture users' attention to different modalities on each factor in user preference modeling. In particular, we employ a disentangled representation technique to ensure the features of different factors in each modality are independent of each other. A multimodal attention mechanism is then designed to capture users' modality preference for each factor. Based on the estimated weights obtained by the attention mechanism, we make recommendations by combining the preference scores of a user's preferences to each factor of the target item over different modalities. Extensive evaluation on five real-world datasets demonstrate the superiority of our method compared with existing methods.

연구 동기 및 목표

  • 기존 다중모달 추천 시스템이 모든 모달리티를 동일하게 취급하여 특정 항목 요소에 대해 사용자 고유의 모달리티 선호도를 忽시하는 한계를 해결하기 위해.
  • 사용자가 항목의 다양한 측면(예: 품질 대 비주얼 외관)을 평가할 때, 텍스트와 이미지 등 서로 다른 모달리티를 어떻게 우선순위를 두는지 모델링하기 위해.
  • 각 모달리티 내에서 항목 요소의 표현을 분리하여 상호 간섭 없이 독립적이고 해석 가능한 특징 학습을 보장하기 위해.
  • 사용자 고유의 모달리티 선호도를 반영한 주의 힘을 가진 가중치를 사용해 모달리티별 선호도 점수를 조합함으로써 추천 성능 향상시키기 위해.
  • 분리 표현과 모달리티 선호도 모델링의 효과를 타당화하기 위해 추출 실험과 비교 실험을 수행하기 위해.

제안 방법

  • 모델은 각 모달리티의 특징을 독립적인 요소(예: 품질, 외관 등)로 분해하는 분리 표현 학습을 활용하여 요소 간 간섭이 없도록 보장한다.
  • 사용자 고유의 주의 힘을 학습하기 위해 다중모달 주의 메커니즘을 도입하여, 각 요소에 대해 각 모달리티가 사용자 선호도에 기여하는 정도를 나타낸다.
  • 각 요소에 대해 학습된 주의 힘을 사용해 모달리티별 표현의 가중 조합을 계산하고, 개인화된 선호도 점수를 생성한다.
  • 최종 추천 점수는 모든 요소와 모달리티에 걸쳐 선호도 점수를 집계하여 얻으며, 주의 힘은 사용자별로 동적으로 조정된다.
  • 사용자-항목 상호작용 예측과 분리 표현 학습을 동시에 최적화하는 통합 손실 함수를 사용해 엔드 투 엔드로 모델을 훈련시킨다.
  • 추출 실험은 주의 힘, 분리, 사용자 고유의 선호도 모델링의 영향을 분리하여 구성 요소를 제거하고 성능 비교를 통해 평가한다.

실험 결과

연구 질문

  • RQ1모든 항목 요소에 대해 사용자 고유의 모달리티 선호도를 요소 수준에서 모델링하는 것이, 균일한 다중모달 융합 방식에 비해 추천 성능 향상에 얼마나 기여하는가?
  • RQ2각 모달리티 내에서 항목 요소를 분리함으로써 표현 품질과 추천 정확도 향상에 어느 정도 영향을 미치는가?
  • RQ3다양한 항목 요소에서 텍스트, 시각, 기타 모달리티의 상대적 기여도는 어떠한가?
  • RQ4분리된 요소의 수가 모델 성능에 미치는 영향은 어떠하며, 최적의 요소 수는 무엇인가?
  • RQ5제안된 모델은 실세계 데이터셋에서 최고 수준의 다중모달 및 분리 추천 방법들을 능가하는가?

주요 결과

  • DMRL은 다섯 개인 실세계 데이터셋에서 최고 수준의 방법들보다 뛰어난 성능을 보이며, 요소 수준에서 모달리티 선호도를 모델링하는 것이 효과적임을 입증한다.
  • 추출 실험 결과, 사용자 고유의 모달리티 주의 힘을 제거한 경우(DMRL w/o u) 성능 저하가 발생함을 확인하여 개인화의 중요성을 확인한다.
  • 대부분의 데이터셋에서 시각 모달리티 전용 모델(DMRL v)이 텍스트 전용 모델(DMRL t)보다 Recall@20에서 성능이 뛰어나, 시각적 특징이 선호도 모델링에 더 큰 영향을 미침을 시사한다.
  • 2 또는 4개의 분리된 요소에서 모델 성능이 최고로 나타나며, K=8일 때 성능 저하가 발생함을 통해 작은 임bedding 크기에서 표현력의 한계를 보여준다.
  • 주목할 만한 주의 힘 없이 학습된 모델(DMRL w/o a)은 단일 모달리티 기반 모델조차도 떨어지며, 주의 기반 모달리티 가중치의 필수성을 강조한다.
  • Sports 데이터셋에서 전모달리티 방법은 부분 모달리티 방법보다 성능이 열 劣하므로, 다중모달 융합 과정에서 잠재적인 일관성 없는 요소나 노이즈가 존재할 수 있으며, 향후 연구가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.