Skip to main content
QUICK REVIEW

[论文解读] Graph Representation learning for Audio & Music genre Classification.

Shubham Dokania, Vasudev Singh|arXiv (Cornell University)|Oct 23, 2019
Music and Audio Processing参考文献 33被引用 6
一句话总结

该论文提出GrahAM,一种新颖的图神经网络(GNN)框架,通过将孪生网络与图表示学习相结合,实现音频和音乐流派分类。通过将频谱图建模为节点,并利用孪生相似性学习边权重,GrahAM在GTZAN数据集上达到99.5%的最先进准确率,在类别不平衡的AudioSet数据集上达到91.3%的准确率,通过增强特征表示和关系归纳偏置,超越了先前方法。

ABSTRACT

Music genre is arguably one of the most important and discriminative information for music and audio content. Visual representation based approaches have been explored on spectrograms for music genre classification. However, lack of quality data and augmentation techniques makes it difficult to employ deep learning techniques successfully. We discuss the application of graph neural networks on such task due to their strong inductive bias, and show that combination of CNN and GNN is able to achieve state-of-the-art results on GTZAN, and AudioSet (Imbalanced Music) datasets. We also discuss the role of Siamese Neural Networks as an analogous to GNN for learning edge similarity weights. Furthermore, we also perform visual analysis to understand the field-of-view of our model into the spectrogram based on genre labels.

研究动机与目标

  • 解决音乐流派分类中数据有限且类别不平衡的挑战。
  • 通过捕捉音频片段之间的细粒度相似性,改进频谱图中的特征表示。
  • 利用图神经网络建模音频样本之间的关系结构,超越局部空间模式。
  • 开发一种数据高效的方法,在不依赖基于图像的数据增强的前提下,最大化表示能力。

提出的方法

  • 该方法使用权重共享的孪生神经网络,从MEL频谱图中学习鲁棒且具有判别性的嵌入表示,实现音频对之间的比较。
  • 图中的边权重通过孪生相似性函数 sij = Λ(φ(xi), φ(xj)) 学习得到,其中 φ 为特征提取器(XceptionNet),Λ 为顶层拼接层。
  • 图卷积层通过消息传递处理节点和边特征:h_i^{(l+1)} = σ(∑_{j∈N(i)} W_l * h_j^{(l)} + b_l),特征通过距离和点积操作的拼接获得。
  • 模型使用图神经网络(GNN)进行节点级别分类,将每个频谱图片段视为具有学习嵌入表示的节点。
  • 为确保训练平衡,作者从全部组合中采样部分正负对,以保持相似对与不相似对之间1:1的比例。
  • 通过Grad-CAM生成显著图,增强可视化可解释性,突出对流派预测至关重要的频域-时域区域。

实验结果

研究问题

  • RQ1图神经网络能否有效建模音频频谱图中的关系结构,以提升流派分类性能?
  • RQ2将孪生网络与GNN结合,相较于独立的CNN或传统分类器,如何增强特征表示?
  • RQ3GNN在类别不平衡且复杂的音频数据集(如AudioSet)上,其泛化能力如何,尤其在流派边界模糊的情况下?
  • RQ4频谱图的哪些区域对流派分类最具预测性,且与人类感知是否一致?

主要发现

  • GrahAM在GTZAN数据集上达到99.5%的最先进准确率,显著优于先前方法,如广播机制(93.9%)和多DNN(93.4%)。
  • 在类别不平衡的AudioSet数据集上,当每类仅使用100个标注样本训练时,GrahAM达到91.3%的准确率,超过随机森林(86.0%)和两层神经网络(87.0%)。
  • t-SNE可视化显示,GrahAM学习到的特征聚类更紧密、更具可分性,表明其表示学习能力得到提升。
  • Grad-CAM显著图一致突出频域-时域中的纹理模式对流派分类至关重要,而非孤立的频带。
  • 即使在小样本标注划分(如每类30、50、100个样本)下,模型仍保持高性能,展现出强大的数据效率。
  • 该方法避免使用基于图像的数据增强,因其对频谱图像素具有语义敏感性,从而保持了音频特异性信息的完整性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。