[论文解读] Audio Cover Song Identification using Convolutional Neural Network
本文提出一种基于卷积神经网络(CNN)的方法,通过将歌曲对的互相关相似性矩阵视为图像,检测指示覆盖关系的有意义模式,以实现音频覆盖歌曲识别。该方法在性能上达到当前最先进水平,MNIT10为8.04,MR1为2.50,优于以往的基于规则和度量学习的方法。
In this paper, we propose a new approach to cover song identification using a CNN (convolutional neural network). Most previous studies extract the feature vectors that characterize the cover song relation from a pair of songs and used it to compute the (dis)similarity between the two songs. Based on the observation that there is a meaningful pattern between cover songs and that this can be learned, we have reformulated the cover song identification problem in a machine learning framework. To do this, we first build the CNN using as an input a cross-similarity matrix generated from a pair of songs. We then construct the data set composed of cover song pairs and non-cover song pairs, which are used as positive and negative training samples, respectively. The trained CNN outputs the probability of being in the cover song relation given a cross-similarity matrix generated from any two pieces of music and identifies the cover song by ranking on the probability. Experimental results show that the proposed algorithm achieves performance better than or comparable to the state-of-the-art.
研究动机与目标
- 通过建模歌曲对之间互相关相似性矩阵中的结构模式,提升音频覆盖歌曲识别性能。
- 通过利用深度学习实现端到端模式识别,克服传统基于特征和距离度量方法的局限性。
- 将覆盖歌曲识别重新定义为图像分类任务,应用CNN处理互相关相似性矩阵。
- 实现比现有基于规则和度量学习方法更高的准确率和更优的排序性能。
- 探索仅使用歌曲前180秒进行有效覆盖检测的可行性,尽管歌曲长度存在差异。
提出的方法
- 使用键对齐的欧几里得距离,从两首歌曲的12维色度特征构建互相关相似性矩阵S,并通过max(Δ)进行归一化。
- 仅使用每首歌曲的前180秒,对较短的音轨进行零填充,以标准化输入长度。
- 在平衡的覆盖与非覆盖歌曲矩阵对上,使用带有批量归一化和两个dropout层(p=0.5, q=0.5)的12层CNN进行训练。
- 在训练前通过零均值单位标准化进行特征缩放,以改善收敛性。
- 使用CNN的softmax输出对候选歌曲进行排序,根据预测的覆盖可能性选择前N个覆盖歌曲。
- 通过嵌套网格搜索优化超参数,并在交叉熵损失低于10^-4时启用早停策略。
实验结果
研究问题
- RQ1CNN能否有效学习互相关相似性矩阵中的判别性模式,以识别覆盖歌曲关系?
- RQ2仅使用歌曲前180秒是否足以提供准确的覆盖检测信息,相较于完整长度分析?
- RQ3所提出的基于CNN的方法在性能上与基于规则(如SimPLe)和基于度量学习的方法相比如何?
- RQ4该模型能否在不依赖手工设计特征或复杂嵌入技术的情况下,对未见的覆盖版本具有良好泛化能力?
- RQ5如dropout和批量归一化等架构选择对模型泛化能力和性能有何影响?
主要发现
- 所提出的CNN在MNIT10上达到8.04,表明平均而言,10个排名最高的候选中包含8.04个正确的覆盖歌曲。
- 模型在MAP上达到0.84,显著优于基线方法SimPLe(0.66)和增强度量学习的版本(0.81)。
- MR1为2.50,意味着平均而言,第一个正确覆盖歌曲排在第2.5位——比第二好的方法(SimPLe,MR1=5.6)提高了80.1%。
- 在最优超参数(p=0.5, q=0.5)下,模型在验证集上达到83.4%的验证准确率,表明其在验证集上具有强大的泛化能力。
- 尽管仅使用每首歌曲的前180秒,该方法仍优于使用完整音频输入的系统。
- 相较于第二好的方法(Heo et al., 2017),性能提升在排序质量(MR1)方面最为显著,表明其在top-k检索中的可靠性更强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。