Skip to main content
QUICK REVIEW

[논문 리뷰] Hit Song Prediction Based on Early Adopter Data and Audio Features

Dorien Herremans, Tom Bergmans|arXiv (Cornell University)|2020. 10. 16.
Music and Audio Processing참고 문헌 4인용 수 7
한 줄 요약

이 연구는 Last.FM에서의 초기 수용자 청취 행동과 EchoNest API에서 제공하는 오디오 특징을 조합한 하이브리드 히트 곡 예측 모델을 제안한다. 초기 수용자 데이터를 바탕으로 로지스틱 회귀를 적용한 결과, 상위 20개 댄스 히트 곡을 예측하는 데 AUC가 0.79에 도달하였으며, 오직 오디오 특징에 의존하는 모델보다 뛰어난 성능을 보였고, 차트 성공 이전에 사회적 청취 패턴이 예측 가능하다는 것을 입증하였다.

ABSTRACT

Billions of USD are invested in new artists and songs by the music industry every year. This research provides a new strategy for assessing the hit potential of songs, which can help record companies support their investment decisions. A number of models were developed that use both audio data, and a novel feature based on social media listening behaviour. The results show that models based on early adopter behaviour perform well when predicting top 20 dance hits.

연구 동기 및 목표

  • 초기 수용자의 소셜 미디어 청취 행동과 오디오 특징을 통합하여 히트 곡 예측 정확도를 향상시키는 것.
  • 이전 모델이 오직 오디오 또는 메타데이터에 의존하는 데서 비롯하는 한계를 해결하기 위해 실시간 청취 동적 패턴을 통합하는 것.
  • Last.FM과 같은 플랫폼에서의 초기 수용자 행동이 차트 순위가 나타나기 이전에 향후 히트 잠재력을 신호로 줄 수 있다는 가설을 검증하는 것.
  • 향후 연구를 위해 Ultratop 50 히트 곡 데이터, Bubbling Under 차트에 진입하지 않은 곡들, 정제된 Last.FM 청취 기록을 조합한 기준 데이터셋을 구축하는 것.

제안 방법

  • 2011~2013년 벨기에 Ultratop 50 댄스 차트에서 8,750首 곡을 수집하였으며, 상위 20개 곡은 히트 곡으로, 차트에 진입하지 않은 곡들은 비히트 곡으로 레이블링하였다.
  • EchoNest API를 통해 140개의 오디오 특징을 추출하였으며, 이는 댄스성과 핫함 같은 시간적 및 지각적 특징을 포함하며, 사전 계산된 메타특징을 제외한 별도의 데이터셋도 준비하였다.
  • 6개월 창의 3개 사용자 그룹(예: '일관되게 새로운 댄스 및 일렉트로닉 음악 청취자')으로부터 854,060건의 Last.FM 청취 기록을 수집하고 정제하였다.
  • 누적 사용자 청취 기반으로 주간 곡 수준의 특징을 구성하였으며, 아직 차트에 진입하지 않았지만 향후 히트 곡이 될 것으로 예측되는 곡들에 대해 '예측 가능한' 레이블을 부여하였다.
  • 10겹 교차검증을 사용하여 오디오 특징, 초기 수용자 행동, 병합된 데이터셋에 대해 다수의 분류기(로지스틱 회귀, SVM, RIPPER, 나이브 베이즈, C4.5)를 훈련시켰다.
  • AUC(ROC 곡선 아래 면적)를 사용하여 성능을 평가하였으며, 오디오 전용 모델, 메타특징 모델, 초기 수용자 행동 모델에 대해 별도 분석을 실시하였다.

실험 결과

연구 질문

  • RQ1Last.FM에서의 초기 수용자 청취 행동은 오직 오디오 특징에 의존하는 것보다 미래의 상위 20개 댄스 히트 곡을 더 정확하게 예측할 수 있는가?
  • RQ2사회적 청취 역학을 통합함으로써 전통적인 오디오 특징 기반 모델에 비해 히트 곡 예측 성능이 어떻게 향상되는가?
  • RQ3사전 계산된 메타특징(예: '핫함')이 오디오 데이터에 포함될 경우 예측 성능에 어떤 영향을 미치며, 순수하게 원시 오디오 특징에 의존하는 모델도 강력한 성능을 달성할 수 있는가?
  • RQ4다양한 Last.FM 사용자 그룹 간에 미래 히트 곡을 식별하는 데 있어 예측 능력에 유의미한 차이가 존재하는가?
  • RQ5오디오와 사회적 청취 데이터를 병합한 모델은 개별 모델보다 성능이 뛰어나며, 하이퍼파ram터 튜닝을 통해 추가로 향상시킬 수 있는 잠재력이 있는가?

주요 결과

  • 초기 수용자 청취 행동 기반의 로지스틱 회귀 모델이 가장 높은 AUC 0.79를 기록하였으며, 오직 오디오 특징에 의존하는 모델보다 유의미하게 뛰어난 성능을 보였다.
  • 원시 EchoNest 특징을 사용한 오디오 전용 모델은 최대 AUC 0.64를 기록하였으며, 메타특징이 없는 한계로 인해 예측 능력이 제한됨을 시사하였다.
  • 메타특징(예: '핫함')을 통합함으로써 모델 성능이 AUC 0.77까지 향상되었으며, 이러한 특징들이 이미 차트 성공 신호를 내재하고 있을 가능성이 있음을 시사하였다.
  • 초기 수용자 행동 기반 모델은 나이브 베이즈로 AUC 0.70, 로지스틱 회귀로 AUC 0.79를 기록하였으며, 강력한 예측 가치를 입증하였다.
  • 초기 수용자 행동 기반 모델은 다양한 분류기에서 일관된 성능을 보였으며, 로지스틱 회귀가 가장 정확한 결과를 내어 모델 선택에 대한 강건성을 입증하였다.
  • 이 연구는 사회적 청취 데이터가 히트 잠재력의 선도적 지표가 될 잠재력을 드러내었으며, SVM에 대한 별도의 파rameter 튜닝 없이도 성능이 우수함을 보였다. 이는 향후 튜닝을 통해 더 향상시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.