Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Heterogeneous Metadata for Video Recommendation with Two-tower Model

Jianling Wang, Ainur Yessenalina|arXiv (Cornell University)|2021. 09. 22.
Recommender Systems and Techniques참고 문헌 20인용 수 7
한 줄 요약

이 논문은 냉각기(콜드스타트) 및 뜨거운기(워머스타트) 제목 모두의 영상 추천 성능을 향상시키기 위해 이질적 메타데이터—범주형 특징, 텍스트 개요, 커버 아트 이미지—를 주목사용 기반 융합 레이어를 통해 활용하는 이중타워 신경망 모델을 제안한다. 모델은 메타데이터 모odal의 적응형 가중치를 부여함으로써 최신 기준 성능을 달성하며, 특히 냉각기 콘텐츠의 정밀도와 재현율 측면에서 기준 모델을 크게 능가한다. 뜨거운기 항목의 경우도 강력한 성능 유지를 유지한다.

ABSTRACT

Online video services acquire new content on a daily basis to increase engagement, and improve the user experience. Traditional recommender systems solely rely on watch history, delaying the recommendation of newly added titles to the right customer. However, one can use the metadata information of a cold-start title to bootstrap the personalization. In this work, we propose to adopt a two-tower model, in which one tower is to learn the user representation based on their watch history, and the other tower is to learn the effective representations for titles using metadata. The contribution of this work can be summarized as: (1) we show the feasibility of using two-tower model for recommendations and conduct a series of offline experiments to show its performance for cold-start titles; (2) we explore different types of metadata (categorical features, text description, cover-art image) and an attention layer to fuse them; (3) with our Amazon proprietary data, we show that the attention layer can assign weights adaptively to different metadata with improved recommendation for warm- and cold-start items.

연구 동기 및 목표

  • 관심사가 없는 뷰잉 이력이 없는 신규 추가된(냉각기) 영상을 추천하는 문제를 해결하기 위해.
  • 범주형 특징, 텍스트 개요, 커버 아트 이미지 등 다양한 메타데이터 유형이 영상 표현 학습 향상에 기여하는지 탐색하기 위해.
  • 냉각기 및 뜨거운기 추천을 위한 효율적인 사용자 및 항목 표현 학습을 가능하게 하는 통합된 이중타워 아키텍처를 설계하기 위해.
  • 이질적 메타데이터 모달을 융합할 때 주목사용 기반 융합과 단순 연결의 영향을 평가하기 위해.
  • 냉각기 시나리오에서 ID 임베딩과 메타데이터 표현 간의 상호작용을 분석하기 위해.

제안 방법

  • 사용자 표현은 뷰잉 이력에서 학습하고, 항목 표현은 메타데이터에서 학습하는 이중타워 신경망 아키텍처를 사용한다.
  • 항목 타워는 세 가지 별도의 메타데이터 모달을 처리한다: 범주형 특징(예: 장르, 출연진), 텍스트 개요(BERT 기반 인코딩을 통해), 커버 아트 이미지(사전 훈련된 CNN 임베딩을 통해).
  • 다양한 메타데이터 모달에서의 표현을 동적으로 융합하기 위해 주목사용 레이어를 도입하며, 추천 작업에 대한 관련성에 따라 적응형 가중치를 할당한다.
  • 최종 항목 표현은 모달 별 임베딩의 가중합으로 계산되며, 주목사용 가중치는 훈련 중에 학습된다.
  • 사용자 및 항목 임베딩은 도트곱을 통해 조합되어 사용자-항목 상호작용 점수를 예측한다.
  • 모델은 고정된 임베딩 크기 512와 학습률 0.001을 사용한 Adam 옵timizer로 훈련된다.

실험 결과

연구 질문

  • RQ1이중타워 모델은 냉각기 제목의 영상 추천 향상에 있어 이질적 메타데이터를 효과적으로 활용할 수 있는가?
  • RQ2범주형 특징, 텍스트 개요, 커버 아트 이미지 등 다양한 메타데이터 유형이 항목 표현 학습에 어떻게 기여하는가?
  • RQ3주목사용 기반 융합 메커니즘이 메타데이터 표현을 단순 연결하는 것보다 영상 추천에서 더 우수한 성능을 내는가?
  • RQ4ID 임베딩은 냉각기 추천 성능에 어떤 영향을 미치며, 메타데이터 표현과의 상호작용은 어떠한가?
  • RQ5주목사용 가중치는 메타데이터 모달 간에 어떻게 분포하는가? 이는 각 모달의 상대적 중요도를 어떻게 반영하는가?

주요 결과

  • 주목사용 기반 융합 모델은 단일 메타데이터 유형만 사용하는 모델보다 유의미하게 뛰어난 성능을 보이며, 다양한 모달 간 적응형 가중치의 효과를 입증한다.
  • 범주형 특징이 표현 학습에 가장 기여하며, 그 다음으로 텍스트 개요가 기여하고, 커버 아트 이미지는 가장 낮은 주목사용 가중치를 받는다.
  • 냉각기 추천의 경우, ID 임베딩이 없는 모델이 ID 임베딩이 있는 버전보다 더 높은 정밀도@6 및 재현율@6 성능을 보이며, ID 임베딩이 주목사용을 지배하고 유용한 메타데이터 신호를 억압할 수 있음을 시사한다.
  • 주목사용 융합을 적용한 모델은 냉각기 영화에 대해 무작위 기준 대비 정밀도@6를 1221.73% 향상시키고 재현율@6를 368.75% 향상시켰으며, TV 시리즈의 경우 정밀도@6는 486.36%, 재현율@6는 57.69% 향상되었다.
  • ID 임베딩이 포함된 경우 커버리지 지표(Coverage@6 및 ConCov@6)는 略로 높아져, 냉각기 설정에서 다양성과 정확도 사이의 상충 관계를 반영한다.
  • 시각화 결과는 범주형 특징이 가장 높은 주목사용 가중치를 받는 반면, 커버 아트 특징는 일관되게 낮게 조정됨을 확인하며, 현재 설정에서 정보량이 낮음을 반영한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.