Skip to main content
QUICK REVIEW

[논문 리뷰] Modelling Sequential Music Track Skips using a Multi-RNN Approach

Christian Hansen, Casper Worm Hansen|arXiv (Cornell University)|2019. 03. 20.
Music and Audio Processing참고 문헌 10인용 수 7
한 줄 요약

이 논문은 스트리밍 세션에서 순차적인 음악 트랙 스킵을 예측하기 위한 멀티-RNN 모델을 제안한다. 이는 두 가지 분지로 구성된 스타킹된 LSTM 아키텍처를 사용한다: 첫 번째 반절을 모델링하기 위한 인코더 네트워크와 두 번째 반절의 스킵을 예측하기 위한 예측 네트워크이다. 이 방법은 평균 평균 정확도 0.641과 첫 번째 스킵 예측 정확도 0.807을 기록했으며, 스포티파이 순차 스킵 예측 챌린지에서 45개 팀 중 2위를 차지했다.

ABSTRACT

Modelling sequential music skips provides streaming companies the ability to better understand the needs of the user base, resulting in a better user experience by reducing the need to manually skip certain music tracks. This paper describes the solution of the University of Copenhagen DIKU-IR team in the 'Spotify Sequential Skip Prediction Challenge', where the task was to predict the skip behaviour of the second half in a music listening session conditioned on the first half. We model this task using a Multi-RNN approach consisting of two distinct stacked recurrent neural networks, where one network focuses on encoding the first half of the session and the other network focuses on utilizing the encoding to make sequential skip predictions. The encoder network is initialized by a learned session-wide music encoding, and both of them utilize a learned track embedding. Our final model consists of a majority voted ensemble of individually trained models, and ranked 2nd out of 45 participating teams in the competition with a mean average accuracy of 0.641 and an accuracy on the first skip prediction of 0.807. Our code is released at https://github.com/Varyn/WSDM-challenge-2019-spotify.

연구 동기 및 목표

  • 사용자 스킵 행동을 순차적 청취 세션에서 모델링하여 음악 추천 시스템을 향상시키는 것.
  • 첫 번째 반절만을 맥락으로 사용하여 사용자가 세션의 두 번째 반절에서 스킵할 트랙을 예측하는 것.
  • 명시적인 사용자 프로필 없이도 시간적 동적 변화와 사용자 선호도를 포착하는 딥러닝 모델을 개발하는 것.
  • 학습된 트랙 및 세션 임베딩을 활용하여 스킵 예측 성능을 향상시키는 것.
  • 스포티파이 순차 스킵 예측 챌린지에서 최고 성능을 달성하는 것.

제안 방법

  • 모델은 두 가지 다른 스타킹된 장기 단기 기억(LSTM) 네트워크를 사용한다: 첫 번째 반절을 처리하기 위한 인코더와 두 번째 반절의 스킵을 예측하기 위한 예측기이다.
  • 인코더는 메타특성(예: 사용자 프리미엄 상태, 요일, 세션 길이 등)에서 유도된 세션 전반에 걸친 임베딩과 글로벌 트랙 인코딩으로 초기화된다.
  • 두 네트워크 모두 트랙 특성(예: 비트 강도, 평탄성 등)과 훈련 가능한 임베딩 레이어를 조합한 학습된 트랙 임베딩을 사용한다.
  • 입력 시퀀스는 인코더에 대해 전처리 패딩, 예측기에는 후행 패딩을 적용하여 가변 길이 세션에 대응하며, 고정된 시퀀스 길이 10개 시간 단위를 사용한다.
  • 다양한 배치 크기(50–400)로 독립적으로 훈련된 다섯 개의 모델을 이용한 다수결 투표 앙상블을 사용하여 일반화 및 성능 향상을 도모했다.
  • 모델은 고정된 초기 임베딩 크기 50, LSTM 레이어 크기 100 및 500, 스킵 예측을 위한 최종 완전 연결 레이어 크기 500을 사용하여 Adam 옵timizer로 훈련되었다.

실험 결과

연구 질문

  • RQ1두 분지 RNN 아키텍처는 음악 스트리밍 세션에서 순차적 스킵 행동을 효과적으로 모델링할 수 있는가?
  • RQ2학습된 세션 전반 임베딩과 트랙 임베딩은 기준 모델 대비 스킵 예측 정확도를 얼마나 향상시킬 수 있는가?
  • RQ3다양한 배치 크기로 훈련된 모델의 앙상블 평균화가 검증 세트에서 일반화 및 성능 향상에 기여하는가?
  • RQ4첫 번째 반절만을 입력으로 사용할 때 모델이 세션의 두 번째 반절의 스킵 행동을 얼마나 잘 예측할 수 있는가?
  • RQ5제안된 멀티-RNN 접근법은 히우리스틱 기준 모델 대비 평균 평균 정확도와 첫 번째 스킵 예측 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 멀티-RNN 모델은 스포티파이 순차 스킵 예측 챌린지에서 테스트 세트에서 평균 평균 정확도 0.641을 기록했으며, 45개 팀 중 2위를 차지했다.
  • 첫 번째 스킵 예측 정확도는 0.807에 도달했으며, 세 가지 기준 모델(가장 우수한 기준 모델인 Baseline 3)의 0.537 평균 평균 정확도를 크게 능가했다.
  • 다양한 배치 크기로 훈련된 다섯 개 모델의 다수결 투표 앙상블은 가장 우수한 단일 모델(0.638 평균 평균 정확도)보다 성능 향상을 이뤘다.
  • 다섯 개 앙상블 모델의 예측 간 평균 상관계수는 0.851로 나타나 높은 일관성을 보이며 다수결 투표의 타당성을 뒷받침했다.
  • 모델 성능은 다양한 배치 크기에서 뛰어난 안정성을 보였으며, 배치 크기 300일 때 검증 정확도가 최고 0.638에 도달했다.
  • TensorFlow의 cuDNNLSTM 사용으로 1억 3천만 개 세션 데이터셋에서 효율적인 훈련이 가능했으며, 각 모델은 Titan X GPU에서 40~60시간 동안 훈련되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.