[论文解读] Hit Song Prediction for Pop Music by Siamese CNN with Ranking Loss
本文提出一种带有排序损失的孪生卷积神经网络(CNN),用于歌曲热门程度预测,将任务视为相对排序问题而非回归问题。通过使用发行后第60天的日播放量及A/B采样方法解决数据不平衡问题,该模型在准确率上显著优于基线回归模型,使用音频亮点和标签特征时表现最佳。
A model for hit song prediction can be used in the pop music industry to identify emerging trends and potential artists or songs before they are marketed to the public. While most previous work formulates hit song prediction as a regression or classification problem, we present in this paper a convolutional neural network (CNN) model that treats it as a ranking problem. Specifically, we use a commercial dataset with daily play-counts to train a multi-objective Siamese CNN model with Euclidean loss and pairwise ranking loss to learn from audio the relative ranking relations among songs. Besides, we devise a number of pair sampling methods according to some empirical observation of the data. Our experiment shows that the proposed model with a sampling method called A/B sampling leads to much higher accuracy in hit song prediction than the baseline regression model. Moreover, we can further improve the accuracy by using a neural attention mechanism to extract the highlights of songs and by using a separate CNN model to offer high-level features of songs.
研究动机与目标
- 通过建模歌曲相对受欢迎程度而非绝对播放量回归来提升歌曲热门预测性能。
- 通过在孪生训练中引入新颖的成对采样策略,解决热门歌曲与非热门歌曲之间的数据不平衡问题。
- 通过结合音乐缩略模型生成的高层音频表征和标签特征,提升模型性能。
- 评估联合使用排序损失与回归损失的多目标学习在预测音乐热门潜力方面的有效性。
提出的方法
- 采用孪生CNN架构,在两个相同的子网络之间共享权重,基于音频嵌入比较歌曲对的相似性。
- 模型联合优化两种损失函数:用于热门评分回归的均方误差(MSE)损失,以及带间隔的成对排序损失,以保持歌曲相对受欢迎程度。
- 提出三种成对采样方法——朴素采样、A/B采样和艺术家采样,用于构建训练对,其中A/B采样特别设计用于平衡热门与非热门歌曲对。
- 使用音乐缩略模型(JYnet)提取音频特征,生成30秒的亮点片段(HL-30),相比中间段采样能提升表征质量。
- 将额外的标签特征(如流派、情绪等)与音频嵌入拼接,以丰富输入表征。
- 最终模型结合音频特征、标签特征与孪生架构,采用多目标损失函数,预测歌曲的相对热门潜力。
实验结果
研究问题
- RQ1将歌曲热门预测建模为排序问题是否能提升相对于传统回归方法的性能?
- RQ2不同成对采样策略对模型性能有何影响,特别是在处理歌曲受欢迎程度分布不平衡的问题上?
- RQ3整合高层音频表征(如歌曲亮点)和元数据标签是否能提升预测准确率?
- RQ4与单目标模型相比,采用排序损失与回归损失联合训练的多目标学习在多大程度上提升了歌曲热门预测性能?
主要发现
- 采用A/B采样和排序损失的孪生CNN在nDCG@10%上达到0.3484,显著优于最佳基线回归模型(nDCG@10% = 0.2753)。
- 使用JYnet缩略模型生成的音频亮点(HL-30)相比中间段采样(Mid-30)提升了性能,表明其更能有效表征歌曲的显著内容。
- A/B采样方法有效缓解了数据不平衡问题,使Kendall’s τ(0.1868)和Spearman’s ρ(0.2421)均高于其他采样策略。
- 在所有模型中,引入音乐标签均提升了性能,最佳结果来自结合A/B采样、标签与音频亮点(nDCG@10% = 0.3484)。
- A/B采样与艺术家采样联合使用仅带来微小性能提升,表明这两种采样方法的组合附加收益有限。
- 使用发行后第60天的日播放量而非累计播放量,可实现更稳定和公平的热门评分估计,减少因发行时间与外部推广高峰带来的偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。