Skip to main content
QUICK REVIEW

[논문 리뷰] A Content-Driven Micro-Video Recommendation Dataset at Scale

Yongxin Ni, Yu Cheng|arXiv (Cornell University)|2023. 09. 27.
Recommender Systems and TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 원시 모odalities(텍스트, 이미지, 오디오, 영상)를 포함한 10억 건의 사용자-아이템 상호작용, 3400만 명의 사용자, 100만 개의 영상으로 구성된, 공개된 바 있는 가장 큰 마이크로 비디오 추천 데이터셋인 MicroLens을 소개한다. 이는 추천을 위한 영상 표현의 엔드 투 엔드 학습을 가능하게 하며, 아이템 ID 기반 모델을 능가하고, 특히 쿨스타트 및 인기 아이템 설정에서 원시 영상 특징이 아이템 ID를 효과적으로 대체할 수 있음을 보여준다.

ABSTRACT

Micro-videos have recently gained immense popularity, sparking critical research in micro-video recommendation with significant implications for the entertainment, advertising, and e-commerce industries. However, the lack of large-scale public micro-video datasets poses a major challenge for developing effective recommender systems. To address this challenge, we introduce a very large micro-video recommendation dataset, named "MicroLens", consisting of one billion user-item interaction behaviors, 34 million users, and one million micro-videos. This dataset also contains various raw modality information about videos, including titles, cover images, audio, and full-length videos. MicroLens serves as a benchmark for content-driven micro-video recommendation, enabling researchers to utilize various modalities of video information for recommendation, rather than relying solely on item IDs or off-the-shelf video features extracted from a pre-trained network. Our benchmarking of multiple recommender models and video encoders on MicroLens has yielded valuable insights into the performance of micro-video recommendation. We believe that this dataset will not only benefit the recommender system community but also promote the development of the video understanding field. Our datasets and code are available at https://github.com/westlake-repl/MicroLens.

연구 동기 및 목표

  • 추천 연구를 위한 대규모, 다양한, 고품질의 공개 마이크로 비디오 데이터셋 부족 문제를 해결한다.
  • 풍부한 원시 영상 모달리티(텍스트, 이미지, 오디오, 전체 영상)를 갖춘 벤치마크 데이터셋을 제공하여 콘텐츠 기반 추천 모델을 지원한다.
  • 영상 인코더와 추천 모델을 함께 최적화하는 영상 인코더와 추천 모델의 엔드 투 엔드 학습을 가능하게 한다.
  • 현재 영상 이해와 영상 추천 간의 성능 격차를 조사하고, 영상 표현이 추천 정확도 향상에 미치는 잠재적 기여를 탐색한다.
  • 시각 기반 추천을 위한 사전 훈련 자원을 제공하여 통합적이고 기초 모델 스타일의 추천 모델 개발을 촉진한다.

제안 방법

  • 다양성을 확보하기 위해 홈피 새로 고침을 활용해 소셜 엔터테인먼트 플랫폼에서 40만 개의 시드 마이크로 비디오를 수집했다.
  • 품질과 인기도를 확보하기 위해 상호작용 기반 필터링(최소 10,000개의 좋아요 또는 최소 100개의 댓글)을 수행했다.
  • 각 영상에 대해 제목(텍스트), 커버 이미지, 오디오 클립, 원시 영상 파일의 전체 모달리티를 확보했다.
  • 영상 페이지에서 외부 링크를 크롤링하여 콘텐츠 다양성을 향상시켰다.
  • 100만 개의 영상과 10억 건의 사용자-아이템 상호작용을 포함한 최종 데이터셋을 구성했으며, 사용자 선호도의 대체 지표로 댓글 행동을 사용했다.
  • 10개 이상의 추천 모델과 영상 인코더를 벤치마크했으며, 영상 인코더와 추천 헤드를 함께 최적화하는 새로운 엔드 투 엔드(E2E) 학습 설정을 포함했다.

실험 결과

연구 질문

  • RQ1사전에 추출된 특징을 사용하는 것과 비교해, 영상 인코더와 추천 모델을 함께 엔드 투 엔드로 학습하는 것이 더 뛰어난 추천 성능을 낼 수 있는가?
  • RQ2원시 영상 특징을 사용할 경우와 커버 이미지 또는 아이템 ID만을 사용할 경우의 추천 정확도는 어떻게 비교되는가?
  • RQ3매우 인기 있는 아이템 설정에서도 영상 기반 추천 모델이 아이템 ID 기반 모델을 능가할 수 있는가?
  • RQ4기존의 아이템 ID 기반 또는 이미지 기반 모델과 비교해 원시 영상 표현은 쿨스타트 아이템에서 얼마나 성능 향상을 이룰 수 있는가?
  • RQ5MicroLens는 영상 이해 및 추천 분야의 기초 모델을 위한 사전 훈련 데이터셋으로서의 잠재력을 얼마나 지니고 있는가?

주요 결과

  • 원시 영상에서 직접 표현을 학습하는 VideoRec 모델은 모든 평가 지표에서 IDRec 및 ImageRec 기반 모델을 일관되게 능가한다.
  • 영상 인코더와 추천 모델의 엔드 투 엔드 학습은 최신 기술 수준의 성능을 달성하며, 공동 최적화의 가치를 입증한다.
  • VideoRec는 온기 아이템 설정에서도 IDRec을 능가함으로써, 실질적인 추천 시스템에서 원시 영상 특징이 아이템 ID를 효과적으로 대체할 수 있음을 시사한다.
  • VideoRec는 쿨 아이템에서 뚜렷한 성능 향상을 보이며, 특히 쿨스타트 시나리오에서 더 큰 성과 향상을 보였다(부록 그림 6 참조).
  • 커버 이미지만을 사용하는 ImageRec는 전체 영상 특징을 사용하는 VideoRec보다 성능이 열 劣하므로, 영상 이해에서 시간적 및 운동 정보의 중요성이 높음을 시사한다.
  • MicroLens는 충분한 규모와 다양성을 지녀 기초 모델의 사전 훈련을 지원할 수 있으며, 프레임 수준 샘플링을 통해 트리플렛(10^12) 수준의 사용자-영상 상호작용을 생성할 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.