[논문 리뷰] Hit Song Prediction for Pop Music by Siamese CNN with Ranking Loss
이 논문은 히트 곡 예측을 절대 재생수 회귀가 아닌 상대적 순위 문제로 간주하여, 순위 손실를 사용하는 시아모닉 컨volutional 네트워크(Siamese CNN)를 제안한다. 60일차 재생수를 사용하고 A/B 샘플링을 통해 데이터 불균형 문제를 해결함으로써, 기준 회귀 모델보다 유의미하게 높은 정확도를 달성하였으며, 음악 하이라이트 및 태그 특징을 사용할 경우 최고의 성능을 보였다.
A model for hit song prediction can be used in the pop music industry to identify emerging trends and potential artists or songs before they are marketed to the public. While most previous work formulates hit song prediction as a regression or classification problem, we present in this paper a convolutional neural network (CNN) model that treats it as a ranking problem. Specifically, we use a commercial dataset with daily play-counts to train a multi-objective Siamese CNN model with Euclidean loss and pairwise ranking loss to learn from audio the relative ranking relations among songs. Besides, we devise a number of pair sampling methods according to some empirical observation of the data. Our experiment shows that the proposed model with a sampling method called A/B sampling leads to much higher accuracy in hit song prediction than the baseline regression model. Moreover, we can further improve the accuracy by using a neural attention mechanism to extract the highlights of songs and by using a separate CNN model to offer high-level features of songs.
연구 동기 및 목표
- 절대 재생수 회귀가 아닌 상대적 노래 인기 순위를 모델링하여 히트 곡 예측 성능을 향상시키기.
- 시아모닉 학습에서 새로운 쌍 샘플링 전략을 통해 히트 곡과 비히트 곡 간의 데이터 불균형 문제를 해결하기.
- 음악 토글링 모델을 통한 고수준 음악 표현과 태그 특징을 통합하여 모델 성능을 향상시키기.
- 순위 손실와 회귀 손실을 병합한 다목적 학습의 효과를 평가하여 음악 히트 잠재력 예측에 기여하는지 확인하기.
제안 방법
- 동일한 두 하위 네트워크를 공유 가중치를 가지는 시아모닉 CNN 아키텍처를 사용하여 음성 임베딩 기반의 두 곡 간 비교를 수행한다.
- 모델은 두 손실 함수를 동시에 최적화한다: 히트 점수 회귀를 위한 평균 제곱 오차(MSE)와 상대적 노래 인기 순위를 유지하기 위한 마진이 있는 쌍별 순위 손실.
- 세 가지 쌍 샘플링 방법—기본, A/B, 아티스트 샘플링—이 도입되었으며, A/B 샘플링은 히트 곡과 비히트 곡 쌍의 균형을 맞추기 위해 특별히 설계되었다.
- 음성 특징은 음악 토글링 모델(JYnet)을 사용하여 추출되어 30초 하이라이트 세그먼트(HL-30)를 생성함으로써 중간 세그먼트 샘플링 대비 더 나은 표현 품질을 확보하였다.
- 추가로 장르, 분위기 등의 태그 특징이 음성 임베딩과 결합되어 입력 표현을 풍부하게 하였다.
- 최종 모델는 음성 특징, 태그 특징, 시아모닉 아키텍처, 다목적 손실을 통합하여 상대적 히트 잠재력 예측을 수행한다.
실험 결과
연구 질문
- RQ1히트 곡 예측을 순위 문제로 모델링할 경우 기존의 회귀 기반 접근 방식보다 성능 향상이 이루어지는가?
- RQ2다양한 쌍 샘플링 전략은 불균형한 노래 인기 분포를 다룰 때 모델 성능에 어떤 영향을 미치는가?
- RQ3고수준 음성 표현(예: 곡 하이라이트)과 메타데이터 태그를 통합할 경우 예측 정확도가 향상되는가?
- RQ4순위 손실와 회귀 손실을 모두 포함한 다목적 학습이 단일 목표 모델 대비 히트 곡 예측 성능에 얼마나 기여하는가?
주요 결과
- A/B 샘플링과 순위 손실를 적용한 시아모닉 CNN은 nDCG@10%가 0.3484를 기록하여 최고의 기준 회귀 모델(nDCG@10% = 0.2753)을 크게 앞서는 성능을 보였다.
- JYnet 토글링 모델을 통해 생성된 음악 하이라이트(HL-30)를 사용할 경우 중간 세그먼트 샘플링(Mid-30) 대비 성능 향상이 있었으며, 이는 곡의 핵심 콘텐츠를 더 잘 표현함을 시사한다.
- A/B 샘플링 방법은 데이터 불균형 문제를 효과적으로 완화하여 다른 샘플링 전략 대비 더 높은 Kendall’s τ(0.1868)와 Spearman’s ρ(0.2421)를 기록하였다.
- 모든 모델에서 음악 태그를 통합할 경우 성능 향상이 있었으며, A/B 샘플링, 태그, 음악 하이라이트를 모두 조합한 경우 최고의 결과(nDCG@10% = 0.3484)를 달성하였다.
- A/B 샘플링과 아티스트 샘플링을 융합한 경우 성능 향상이 미미하여, 이 두 샘플링 방법을 병합하는 데 추가적인 이점이 제한적임을 시사한다.
- 누적 재생수 대신 발매 후 60일차의 일일 재생수를 사용함으로써 더 안정적이고 공정한 히트 점수 추정이 가능해졌으며, 발매 시기나 외부 홍보 파동에 의한 편향을 줄였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.