Skip to main content
QUICK REVIEW

[논문 리뷰] TransRec: Learning Transferable Recommendation from Mixture-of-Modality Feedback

Jie Wang, Fajie Yuan|arXiv (Cornell University)|2022. 06. 13.
Machine Learning in Healthcare인용 수 8
한 줄 요약

TransRec는 사용자 및 아이템 ID에 의존하는 대신, 텍스트 및 이미지와 같은 혼합형 다중모달(모달리티) 사용자 피드백에서 학습함으로써 이식 가능한 추천을 위한 새로운 프레임워크를 제안한다. ID 임베딩을 모달리티 전용 인코더(예: 텍스트용 BERT, 이미지용 ResNet)로 대체하고 엔드 투 엔드로 훈련함으로써, 겹치는 사용자나 아이템이 없더라도 다양한 추천 도메인 간에 효과적인 제로샷 및 피처 샘플 기반 전이가 가능해지며, 제한된 데이터로도 하류 작업에서 뚜렷한 성능 향상을 이룬다.

ABSTRACT

Learning large-scale pre-trained models on broad-ranging data and then transfer to a wide range of target tasks has become the de facto paradigm in many machine learning (ML) communities. Such big models are not only strong performers in practice but also offer a promising way to break out of the task-specific modeling restrictions, thereby enabling task-agnostic and unified ML systems. However, such a popular paradigm is mainly unexplored by the recommender systems (RS) community. A critical issue is that standard recommendation models are primarily built on categorical identity features. That is, the users and the interacted items are represented by their unique IDs, which are generally not shareable across different systems or platforms. To pursue the transferable recommendations, we propose studying pre-trained RS models in a novel scenario where a user's interaction feedback involves a mixture-of-modality (MoM) items, e.g., text and images. We then present TransRec, a very simple modification made on the popular ID-based RS framework. TransRec learns directly from the raw features of the MoM items in an end-to-end training manner and thus enables effective transfer learning under various scenarios without relying on overlapped users or items. We empirically study the transferring ability of TransRec across four different real-world recommendation settings. Besides, we look at its effects by scaling source and target data size. Our results suggest that learning neural recommendation models from MoM feedback provides a promising way to realize universal RS.

연구 동기 및 목표

  • 추천 시스템(RS) 분야에서 일반적이고 이식 가능한 추천 모델의 부족을 해결하기 위해, 기존에 ID 기반 협업 필터링에 국한된 모델의 한계를 극복하고자 한다.
  • 사용자 및 아이템 ID가 아닌 원시적인 다중모달 아이템 특징(예: 텍스트, 이미지)에서 학습하는 새로운 패러다임을 탐색하고자 한다.
  • 혼합형 다중모달 피드백(MoM)에서 유사 모달리티 간 표현을 활용하여 도메인 간 및 제로샷 전이 학습을 가능하게 하기 위해 모달리티에 의존하지 않는 표현을 도입하고자 한다.
  • 제한된 데이터로도 다양한 추천 시나리오에 일반화할 수 있는 TransRec의 능력을 실증적으로 검증하고자 한다.
  • 다중모달 추천에서 엔드 투 엔드 훈련과 동결된 특징 미세조정 간의 성능 상호 간의 트레이드오프를 분석하고자 한다.

제안 방법

  • 기존의 아이템 ID 임베딩을 모달리티 전용 인코더(예: 텍스트용 BERT, 이미지용 ResNet)로 대체하여 원시적 특징 기반의 아이템 표현을 가능하게 한다.
  • 사용자를 다중모달 인코딩된 아이템의 시퀀스로 표현함으로써, ID 기반 상호작용이 아닌 다중모달 콘텐츠 기반의 사용자 선호도를 학습할 수 있도록 한다.
  • 모달리티 인코더와 추천 헤드를 함께 최적화하는 엔드 투 엔드 훈련을 통해 효과적인 전이 학습을 가능하게 한다.
  • ID 기반 추천 모델의 경우 ID 임베딩 레이어를 MoM 인코더로 교체함으로써 프레임워크를 모델에 관계없이 적용 가능하게 하며, 모델에 독립적이고 즉시 사용 가능한 플러그 앤 플레이 아키텍처를 제공한다.
  • 모달리티 특징에 대해 사전 훈련된 인코더(예: BERT, ResNet)를 사용하고 엔드 투 엔드 훈련 중에 미세조정하여 표현 품질을 향상시킨다.
  • 큰 소스 도메인에서 훈련하고, 겹치는 사용자나 아이템이 없는 작은 다각도의 타겟 도메인에서 미세조정함으로써 전이 가능성에 대한 평가를 수행한다.

실험 결과

연구 질문

  • RQ1겹치는 사용자나 아이템이 없더라도 혼합형 다중모달 피드백에서 학습한 추천 모델이 다양한 도메인 간에 일반화할 수 있는가?
  • RQ2모달리티 인코더를 엔드 투 엔드로 훈련하는 것이 동결된 사전 추출 특징을 사용하는 것보다 더 높은 전이 성능을 내는가?
  • RQ3저자료 환경에서 TransRec의 성능은 어떻게 되며, 추천에서의 콜드스타트 문제를 효과적으로 완화할 수 있는가?
  • RQ4다양한 모달리티 조합(텍스트 전용, 이미지 전용, 이미지-텍스트 병합)에서 MoM 피드백의 성능 향상이 일관되게 유지되는가?
  • RQ5모달리티 인코더의 선택(예: BERT 대비 ResNet)이 추천 모델의 전이 가능성과 내구성에 어떤 영향을 미치는가?

주요 결과

  • 큰 소스 데이터셋에서 훈련한 후 10,000개의 사용자 시퀀스만 있는 타겟 데이터셋으로 전이할 때 TransRec는 HR@10에서 53.17% 향상되고 NDCG@10에서도 53.17% 향상되어 강력한 피처 샘플 기반 전이 능력을 입증한다.
  • 타겟 데이터의 60%만 사용해도 TransRec는 기준 모델인 TFS 대비 HR@10에서 26.55% 향상되고 NDCG@10에서 26.70% 향상되어 자료 부족 상황에서도 뛰어난 내구성을 보였다.
  • 엔드 투 엔드 훈련이 항상 동결된 특징 미세조정보다 우수했으며, TN-text 데이터셋에서 TransRec는 동결 특징 대비 HR@10에서 19.40% 높고 NDCG@10에서 18.82% 높은 성능을 기록했다.
  • 모델는 뛰어난 일반화 능력을 보였다: TN-video 도메인에서 TransRec는 엔드 투 엔드 훈련으로 HR@10이 0.0424, NDCG@10이 0.0221을 기록했으며, 동결 기반 베이스라인( HR@10: 0.0040, NDCG@10: 0.0023)을 크게 앞서는 성능을 보였다.
  • TransRec의 성능은 타겟 데이터가 많아질수록 향상되지만, 가장 큰 성과는 저자료 환경에서 관찰되어 콜드스타트 및 자료 부족 상황에서의 가치를 확인했다.
  • 결과는 특히 텍스트용 BERT와 같은 모달리티 인코더 표현이 ResNet에서 유도된 시각적 특징보다 더 일반적이고 효과적임을 시사하며, 이는 모달리티 간 전이 가능성의 차이를 반영한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.