[论文解读] Music Genre Classification with ResNet and Bi-GRU Using Visual Spectrograms
本文提出了一种结合ResNet与双向GRU(Bi-GRU)的混合深度学习模型,使用视觉频谱图作为输入对音乐流派进行分类。该模型在梅尔频谱图上的准确率达到81%,优于传统机器学习方法,证明了在音频表征中同时利用空间特征(通过ResNet)与时间特征(通过Bi-GRU)的有效性,其中梅尔频谱图因与人类听觉感知相匹配而表现出更优性能。
Music recommendation systems have emerged as a vital component to enhance user experience and satisfaction for the music streaming services, which dominates music consumption. The key challenge in improving these recommender systems lies in comprehending the complexity of music data, specifically for the underpinning music genre classification. The limitations of manual genre classification have highlighted the need for a more advanced system, namely the Automatic Music Genre Classification (AMGC) system. While traditional machine learning techniques have shown potential in genre classification, they heavily rely on manually engineered features and feature selection, failing to capture the full complexity of music data. On the other hand, deep learning classification architectures like the traditional Convolutional Neural Networks (CNN) are effective in capturing the spatial hierarchies but struggle to capture the temporal dynamics inherent in music data. To address these challenges, this study proposes a novel approach using visual spectrograms as input, and propose a hybrid model that combines the strength of the Residual neural Network (ResNet) and the Gated Recurrent Unit (GRU). This model is designed to provide a more comprehensive analysis of music data, offering the potential to improve the music recommender systems through achieving a more comprehensive analysis of music data and hence potentially more accurate genre classification.
研究动机与目标
- 为解决大规模音乐流媒体平台中人工音乐流派分类的局限性。
- 克服传统机器学习模型依赖手工特征、难以捕捉复杂音频模式的不足。
- 通过开发一种自动、准确且鲁棒的音乐流派分类系统,提升音乐推荐系统性能。
- 研究视觉频谱图(尤其是梅尔频谱图与STFT)作为深度学习模型输入表征的有效性。
- 探索结合CNN与RNN的混合架构在建模音频数据中空间与时间特征方面的潜力。
提出的方法
- 模型使用视觉梅尔频谱图为输入,将音频信号转换为适合卷积神经网络处理的图像化表示。
- 采用ResNet18主干网络从频谱图图像中提取分层空间特征,利用残差连接缓解梯度消失问题。
- 将ResNet的输出特征图展平后输入双向门控循环单元(Bi-GRU),以建模频谱图数据中的序列时间动态。
- 该混合架构实现了对空间模式(如频谱内容、谐波结构)与时间演化(如节奏变化、随时间的演变)的联合学习。
- 模型使用交叉熵损失与Adam优化器进行训练,并应用时间偏移与音高缩放等数据增强技术以提升鲁棒性。
- 通过使用ImageNet预训练的ResNet18,隐式地利用了迁移学习,增强了对音频频谱图输入的特征学习能力。

实验结果
研究问题
- RQ1结合ResNet与Bi-GRU的混合深度学习模型能否有效利用视觉频谱图对音乐流派进行分类?
- RQ2当使用频谱图输入时,所提模型的性能与KNN和SVM等传统机器学习模型相比如何?
- RQ3频谱图表示的选择——梅尔频谱图与STFT——是否显著影响深度学习模型的分类准确率?
- RQ4视觉频谱图(尤其是梅尔频谱图)在多大程度上与人类听觉感知一致,并能提升模型性能?
- RQ5所提模型能否实现与人类水平流派分类准确率相当的性能?
主要发现
- 所提出的ResNet-Bi-GRU混合模型在使用梅尔频谱图作为输入时,实现了81%的流派分类准确率,显著优于KNN和SVM等传统机器学习模型。
- 该模型性能超过人类水平流派分类的70%基准,表明其在音乐推荐系统中具有强大的实际部署潜力。
- 无论在CNN、Bi-GRU、ResNet18还是混合的ResNet-Bi-GRU模型中,梅尔频谱图始终优于STFT频谱图。
- 与独立的ResNet18或Bi-GRU相比,混合架构表现出更优性能,凸显了结合空间与时间建模的互补优势。
- 结果表明,视觉频谱图(尤其是梅尔尺度)作为深度学习在音乐流派分类中的输入极为有效,因其与人类听觉感知具有高度相关性。
- 本研究证实了从图像分类迁移学习至音频分析的可行性,通过成功将预训练ResNet适配至频谱图输入,验证了该方法的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。