Skip to main content
QUICK REVIEW

[论文解读] Convolutional Neural Network Achieves Human-level Accuracy in Music Genre Classification

Mingwen Dong|arXiv (Cornell University)|Feb 27, 2018
Music and Audio Processing被引用 9
一句话总结

该论文提出一种卷积神经网络(CNN),通过处理3秒的梅尔频谱图片段,利用受听觉系统启发的特征,在10种流派的音乐分类任务中达到人类水平的70%准确率。该方法将音乐分割为重叠的片段,应用具有STRF样滤波器的CNN,并聚合预测结果,优于先前的方法,且模拟了人类感知机制。

ABSTRACT

Music genre classification is one example of content-based analysis of music signals. Traditionally, human-engineered features were used to automatize this task and 61% accuracy has been achieved in the 10-genre classification. However, it's still below the 70% accuracy that humans could achieve in the same task. Here, we propose a new method that combines knowledge of human perception study in music genre classification and the neurophysiology of the auditory system. The method works by training a simple convolutional neural network (CNN) to classify a short segment of the music signal. Then, the genre of a music is determined by splitting it into short segments and then combining CNN's predictions from all short segments. After training, this method achieves human-level (70%) accuracy and the filters learned in the CNN resemble the spectrotemporal receptive field (STRF) in the auditory system.

研究动机与目标

  • 通过深度学习实现音乐流派分类的人类水平准确率。
  • 将人类听觉感知与神经生理学的见解与深度学习模型相融合。
  • 开发一种可扩展、高效的音乐流派分类方法,直接使用原始音频,无需手工设计特征。
  • 探究CNN滤波器是否学习到与人类听觉系统中相似的时频感受野(STRFs)。
  • 在先前使用工程化特征或更短片段的方法基础上,进一步提升分类性能。

提出的方法

  • 该方法通过使用23ms汉宁窗并以50%重叠将波形转换为梅尔频谱图来处理音乐信号。
  • 对梅尔频谱图进行对数变换,以归一化动态范围,并更好地反映人类听觉感知。
  • 模型采用2D CNN,包含两层卷积层(3×3和3×5滤波器)、最大池化层(2×4)以及ReLU激活函数,以提取分层特征。
  • 网络使用全连接层(32和10个神经元)、Softmax输出,并采用L2正则化和Dropout以防止过拟合。
  • 模型在从训练曲目中采样的3秒片段上使用随机梯度下降进行训练,标签来自原始音乐。
  • 全曲的流派预测通过平均所有重叠3秒片段的预测概率得出。

实验结果

研究问题

  • RQ1在短音频片段上训练的CNN能否在10种流派的音乐分类任务中达到人类水平的表现?
  • RQ2CNN学习到的滤波器是否与人类听觉系统中观察到的时频感受野(STRFs)相似?
  • RQ3CNN学习到的表征在流派分类任务中是否比原始梅尔频谱图更具线性可分性?
  • RQ4为何某些流派(如乡村音乐和摇滚乐)的分类准确率较低,尽管整体达到人类水平?
  • RQ5通过分段处理的“分而治之”方法能否有效克服完整音乐信号的高维性?

主要发现

  • 所提出的CNN在10种流派分类任务中达到70%的准确率,与人类在3秒强制选择任务中的表现相当。
  • 该模型优于先前方法,包括一种使用PCA白化频谱图并在5种流派任务中达到70%准确率的方法,实现了在10种流派中更高的分类准确率。
  • CNN卷积层学习到的滤波器在视觉上与神经生理学研究中观察到的STRFs相似,表明其具有生物合理性。
  • 经CNN最后一层隐藏层变换后,测试数据点在LDA投影下显著比在原始梅尔频谱图空间中更具线性可分性。
  • 乡村音乐和摇滚乐的准确率较低(低于平均值),可能是因为其依赖于3秒片段中未捕捉到的长期节奏或节拍特征。
  • 该方法通过梅尔频谱图表示和分段处理,有效降低了维度,同时保留了感知相关的特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。