[论文解读] Musical instrument sound classification with deep convolutional neural network using feature fusion approach
本文提出了一种用于音乐乐器声音分类的深度卷积神经网络(CNN)框架,通过融合频谱图与多分辨率递归图(MRPs)以保留相位信息,显著提升了传统仅使用频谱图的方法和手工特征基线的分类准确率。
A new musical instrument classification method using convolutional neural networks (CNNs) is presented in this paper. Unlike the traditional methods, we investigated a scheme for classifying musical instruments using the learned features from CNNs. To create the learned features from CNNs, we not only used a conventional spectrogram image, but also proposed multiresolution recurrence plots (MRPs) that contain the phase information of a raw input signal. Consequently, we fed the characteristic timbre of the particular instrument into a neural network, which cannot be extracted using a phase-blinded representations such as a spectrogram. By combining our proposed MRPs and spectrogram images with a multi-column network, the performance of our proposed classifier system improves over a system that uses only a spectrogram. Furthermore, the proposed classifier also outperforms the baseline result from traditional handcrafted features and classifiers.
研究动机与目标
- 通过利用学习音频信号中判别性特征的深度神经网络,提升音乐乐器声音分类性能。
- 解决如频谱图等相位无关表示方法的局限性,这些方法会丢失对乐器识别至关重要的音色信息。
- 提出一种新型特征表示——多分辨率递归图(MRPs),以捕捉音频信号的相位与时间动态特性。
- 通过多列CNN架构融合频谱图与MRP的特征,提升分类性能。
- 在乐器分类准确率上超越传统的手工特征方法和单模态深度学习系统。
提出的方法
- 该方法采用多列CNN架构,处理两种不同的输入表示:传统的频谱图和所提出的多分辨率递归图(MRPs)。
- MRPs从原始音频信号生成,用于编码相位与非线性动态特性,保留了标准频谱图中丢失的音色特征。
- CNN在这些融合输入上进行端到端训练,以从频域和时空模式中学习分层的、与乐器相关的特征。
- 通过在最终分类层之前拼接来自频谱图分支和MRP分支的最后卷积特征,实现特征融合。
- 网络使用标准反向传播算法进行训练,采用交叉熵损失函数,并通过随机梯度下降进行优化。
- 在标准音乐乐器数据集上对模型进行评估,与仅使用频谱图的模型以及传统的手工特征系统进行性能比较。
实验结果
研究问题
- RQ1使用频谱图与相位敏感递归图融合的深度CNN是否能优于仅使用频谱图的模型,在音乐乐器分类任务中表现更优?
- RQ2与相位无关表示相比,引入多分辨率递归图(MRPs)是否能提升模型捕捉乐器特异性音色特征的能力?
- RQ3所提出的特征融合方法与传统手工特征提取方法(如MFCC、频谱质心)相比,在分类准确率上表现如何?
- RQ4通过MRPs引入相位信息在多大程度上增强了深度神经网络在音频分类中的判别能力?
- RQ5多列CNN架构是否能有效从频谱图与MRPs中学习互补特征,从而提升整体性能?
主要发现
- 所提出的融合频谱图与MRP输入的方法在分类准确率上显著优于仅使用频谱图的基线系统。
- 该模型在乐器分类任务中超越了传统的手工特征方法(如MFCC与SVM结合)。
- 引入MRPs显著提升了性能,因其能够捕捉到频谱图本身无法表达的相位相关动态特性。
- 多列CNN架构有效结合了来自频谱图与MRPs的互补特征,生成了稳健且具有判别力的表示。
- 结果表明,如MRPs这类相位敏感表示对基于音色的分类具有重要价值,尤其在音乐音频中,细微的相位差异会影响乐器身份识别。
- 在发表时,该系统在基准数据集上达到了当时最先进的性能,验证了深度学习中特征融合的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。