[论文解读] Representation Learning of Music Using Artist Labels
本文提出使用艺术家标签——丰富且客观的元数据——作为音乐音频深度表征学习的监督信号,通过训练两种深度卷积神经网络实现:一种基于标准Softmax的DCNN,另一种用于成对相似性学习的Siamese DCNN。这些模型在使用语义标签的最先进方法中表现相当,证明了艺术家标签在迁移学习设置中作为学习判别性音频特征的稳健且可扩展的替代方案的有效性。
In music domain, feature learning has been conducted mainly in two ways: unsupervised learning based on sparse representations or supervised learning by semantic labels such as music genre. However, finding discriminative features in an unsupervised way is challenging and supervised feature learning using semantic labels may involve noisy or expensive annotation. In this paper, we present a supervised feature learning approach using artist labels annotated in every single track as objective meta data. We propose two deep convolutional neural networks (DCNN) to learn the deep artist features. One is a plain DCNN trained with the whole artist labels simultaneously, and the other is a Siamese DCNN trained with a subset of the artist labels based on the artist identity. We apply the trained models to music classification and retrieval tasks in transfer learning settings. The results show that our approach is comparable to previous state-of-the-art methods, indicating that the proposed approach captures general music audio features as much as the models learned with semantic labels. Also, we discuss the advantages and disadvantages of the two models.
研究动机与目标
- 探索使用艺术家标签——自然产生且客观的元数据——作为音乐表征学习的监督信号。
- 解决无监督特征学习(如浅层次结构)以及噪声语义标签(如流派、情绪)在音乐音频表征中的局限性。
- 比较两种深度学习架构:使用Softmax输出的标准化DCNN与用于成对相似性学习的Siamese DCNN。
- 通过迁移学习评估所学特征在未见音乐数据集上的泛化能力。
- 探究艺术家标签是否可作为昂贵或模糊的语义标注的可行、低成本替代方案。
提出的方法
- 使用Softmax输出层,训练一个标准的一维卷积神经网络(DCNN),将音乐曲目分类为多个艺术家之一。
- 该模型以梅尔频谱图为输入,并在每个卷积层后应用批量归一化和ReLU激活函数。
- 将最终的256维隐藏层特征向量提取为下游任务的所学音频表征。
- 引入Siamese DCNN以处理大规模艺术家集合,通过学习锚点与其它艺术家之间的成对相似性,减少输出层大小。
- Siamese模型使用对比损失,以最大化同艺术家对之间的相似性,同时最小化不同艺术家对之间的相似性。
- 应用迁移学习:将训练好的模型用作特征提取器,在三个基准数据集(GTZAN、NAVER、FMA)上进行音乐分类与检索任务。
实验结果
研究问题
- RQ1丰富的、客观的艺术家标签能否作为深度音乐表征学习的有效监督信号?
- RQ2在特征质量与可扩展性方面,基于艺术家分类训练的标准化DCNN与Siamese DCNN相比表现如何?
- RQ3使用艺术家标签进行表征学习是否能良好泛化至下游任务(如流派分类与音乐检索)?
- RQ4增加艺术家数量如何影响所提模型的性能?
- RQ5通过艺术家标签学习到的特征质量是否与使用语义标签(如流派或情绪)学习到的特征质量相当?
主要发现
- 所提出的基于艺术家标签的DCNN模型在性能上可与使用语义标签的最先进方法相媲美甚至更优,证明了艺术家标签作为监督信号的有效性。
- 在所有数据集上,Siamese DCNN模型在音乐检索任务中的表现优于标准DCNN,表明其更优的成对相似性表征学习能力。
- 两种模型的性能均随艺术家数量增加而提升,且Siamese模型在10,000名艺术家时仍保持持续改进,而标准模型在2,000至5,000名艺术家时趋于饱和。
- t-SNE可视化显示,所学特征按流派、演唱风格和性别聚类,表明模型捕捉到了有意义且语义相关的音频特征。
- Siamese模型更具可扩展性,且在新增艺术家时更易微调,因其无需在新增艺术家时重新训练整个网络。
- 结果表明,艺术家标签是音乐表征学习中噪声大或成本高的语义标注的可行、低成本且高质量的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。