Skip to main content
QUICK REVIEW

[논문 리뷰] Personalized Showcases: Generating Multi-Modal Explanations for Recommendations

Yan An, Zhankui He|arXiv (Cornell University)|2022. 06. 30.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 사용자별로 맞춤화된 이미지와 자연어를 조합하여 추천에 대한 다중 모odal 설명을 생성하는 새로운 작업인 개인화된 쇼케이스를 소개한다. 시각적 및 언어적 출력을 정렬하기 위해 대비 학습을 사용함으로써 제안된 PC²L 프레임워크는 텍스트 중심 기준 대비 더 다양한, 표현력 있는, 그리고 시각적으로 기반을 둔 설명을 생성한다. 이는 Google Local에서 확보한 대규모 데이터셋을 통해 검증되었다.

ABSTRACT

Existing explanation models generate only text for recommendations but still struggle to produce diverse contents. In this paper, to further enrich explanations, we propose a new task named personalized showcases, in which we provide both textual and visual information to explain our recommendations. Specifically, we first select a personalized image set that is the most relevant to a user's interest toward a recommended item. Then, natural language explanations are generated accordingly given our selected images. For this new task, we collect a large-scale dataset from Google Local (i.e.,~maps) and construct a high-quality subset for generating multi-modal explanations. We propose a personalized multi-modal framework which can generate diverse and visually-aligned explanations via contrastive learning. Experiments show that our framework benefits from different modalities as inputs, and is able to produce more diverse and expressive explanations compared to previous methods on a variety of evaluation metrics.

연구 동기 및 목표

  • 텍스트 중심 추천 설명에서의 다양성 부족과 기반 부족 문제를 해결하기 위해.
  • 자연어와 함께 개인화된 시각 콘텐츠를 통합하여 추천 설명을 풍부화하기 위해.
  • 다양하고 시각적으로 정렬되며 사용자 중심인 설명을 생성하는 프레임워크를 개발하기 위해.
  • 개인화된 설명 생성을 위한 고품질, 대규모 다중 모달 데이터셋을 구축하기 위해.
  • 다중 모달 대비 학습을 통해 모델 일반화 능력과 사용자 참여도를 향상시키기 위해.

제안 방법

  • 추천에 대한 시각적 및 언어적 설명을 생성하는 새로운 작업인 개인화된 쇼케이스를 제안한다.
  • Google Local(지도)에서 비즈니스 리뷰, 이미지, 사용자 프로필을 포함한 대규모 다중 모달 데이터셋인 Gest를 구축한다.
  • 인간 레이블링을 통해 고품질의 이미지-문장 쌍 서브셋을 주석 처리하고, CLIP 기반 분류기를 사용해 전체 데이터셋에 레이블을 전파한다.
  • 하드 음성 샘플링을 활용해 생성된 텍스트를 선택된 이미지와 정렬하는 개인화된 다중 모달 대비 학습(PCA²L) 프레임워크를 설계한다.
  • 사용자 리뷰 유사도를 기반으로 음성 샘플의 가중치를 재조정함으로써 개인화를 향상시키는 개인화된 대비 손실을 도입한다.
  • CLIP 임베딩을 다중 모달 인코더로 사용하고, 생성된 설명과 이미지 세트 간의 시각적 정렬도 평가하기 위해 CLIP 기반 메트릭을 정의한다.

실험 결과

연구 질문

  • RQ1이미지와 텍스트를 조합한 다중 모달 설명은 추천 설명의 다양성과 정보성 향상에 기여하는가?
  • RQ2개인화된 추천을 위한 조건부 텍스트 생성 동안 시각적 및 언어적 모달 간에 효과적으로 정렬할 수 있는가?
  • RQ3대비 학습이 다중 모달 환경에서 생성된 설명의 다양성과 표현력 향상에 얼마나 기여하는가?
  • RQ4사용자 중심의 이미지 선택은 생성된 설명의 관련성과 개인화 수준을 향상시키는가?
  • RQ5제안된 PC²L 프레임워크는 텍스트 중심 및 비대비 학습 기반 다중 모달 기준 대비 설명 생성에서 어떻게 뛰어난가?

주요 결과

  • PC²L 프레임워크는 텍스트 중심 및 비대비 기준 대비 설명의 다양성과 시각적 정렬도를 크게 향상시켰다.
  • 인간 평가 결과, 기존 방법 대비 PC²L가 더 표현력 있고 매력적인 설명을 생성하는 것으로 확인되었다.
  • 자동 평가 결과, ROUGE, BLEU, CLIP 기반 시각적 정렬 점수 등 여러 메트릭에서 PC²L가 기준 대비 뛰어난 성능을 보였다.
  • 대비 학습 메커니즘 덕분에 반복적이고 일반적인 표현(예: '음식이 좋다')의 생성 빈도가 감소했다.
  • 개인화된 대비 손실은 사용자 리뷰 유사도를 활용해 음성 샘플의 가중치를 재조정함으로써 성능 향상에 기여했다.
  • 구축된 Gest 데이터셋에는 95,270명의 사용자가 포함되어 있으며, 평균 35.63장의 이미지가 각 비즈니스당 존재하여 고품질의 다중 모달 학습을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.