[论文解读] CNNs-based Acoustic Scene Classification using Multi-Spectrogram Fusion and Label Expansions
该论文提出了一种基于CNN的声学场景分类框架,采用多谱图融合(STFT和CQT)与标签扩展进行多任务学习。通过融合来自多个谱图的深层特征,并引入超类标签以利用类别间的相似性,该方法在LITIS Rouen数据集上实现了0.9744的最先进准确率,在DCASE2017开发集上达到了0.8865的准确率。
Spectrograms have been widely used in Convolutional Neural Networks based schemes for acoustic scene classification, such as the STFT spectrogram and the MFCC spectrogram, etc. They have different time-frequency characteristics, contributing to their own advantages and disadvantages in recognizing acoustic scenes. In this letter, a novel multi-spectrogram fusion framework is proposed, making the spectrograms complement each other. In the framework, a single CNN architecture is applied onto multiple spectrograms for feature extraction. The deep features extracted from multiple spectrograms are then fused to discriminate the acoustic scenes. Moreover, motivated by the inter-class similarities in acoustic scene datasets, a label expansion method is further proposed in which super-class labels are constructed upon the original classes. On the help of the expanded labels, the CNN models are transformed into the multitask learning form to improve the acoustic scene classification by appending the auxiliary task of super-class classification. To verify the effectiveness of the proposed methods, intensive experiments have been performed on the DCASE2017 and the LITIS Rouen datasets. Experimental results show that the proposed method can achieve promising accuracies on both datasets. Specifically, accuracies of 0.9744, 0.8865 and 0.7778 are obtained for the LITIS Rouen dataset, the DCASE Development set and Evaluation set respectively.
研究动机与目标
- 解决声学场景分类中的类别间相似性问题,其中语义相似的场景(如图书馆和书店)被视作不同类别。
- 通过融合多种谱图(STFT、CQT、MFCC)改善特征学习,以捕捉互补的时间-频率特性。
- 通过谱聚类构建超类标签,建模原始类别之间的层次关系,从而提升模型泛化能力。
- 通过扩展标签将单任务CNN转化为多任务学习框架,利用正则化约束将超类与原始类别关联,以正则化特征学习并提升判别能力。
- 通过简单而有效的融合与标签扩展流程,在多种数据集上实现一致的性能提升。
提出的方法
- 使用标准信号处理技术,从每个音频片段生成多种谱图(STFT、CQT、MFCC)。
- 对每种谱图独立应用单一CNN架构(如VGG或ResNet)以提取深层特征。
- 将来自多个谱图的深层特征拼接为每个音频片段的全局特征,并通过PCA进行降维。
- 将多个CNN模型的全局特征聚合为每个音频片段的单一高层表示。
- 在基础分类器输出上应用谱聚类,从原始场景类别构建超类标签。
- 通过增加超类分类的辅助任务,在多任务学习设置下训练CNN模型,并引入将超类与原始类关联的正则化约束。
实验结果
研究问题
- RQ1与单谱图基线相比,使用STFT和CQT的多谱图融合是否能提升声学场景分类的准确率?
- RQ2通过构建超类实现的标签扩展是否能增强特征学习与模型泛化能力?
- RQ3所提方法在具有不同类别分布特征的数据集上的性能表现如何?
- RQ4在何种情况下标签扩展能带来性能增益,而在何种情况下会导致性能下降或失效?
- RQ5所提出的融合与标签扩展框架是否能在DCASE2017和LITIS Rouen等基准数据集上达到最先进性能?
主要发现
- STFT与CQT谱图的融合在LITIS Rouen数据集上实现了0.9744的最高准确率,比所有单谱图基线高出最多0.013。
- 在DCASE2017开发集上,所提方法达到了0.8865的准确率,优于基线CNN-LSTM-GAN方法(0.871)及其他最先进方法。
- 标签扩展在ESC-50数据集上提升了性能,使VGG-LE的准确率从0.7145提升至0.7285,表明其在具有更清晰聚类结构的数据集中具有有效性。
- 该方法在LITIS Rouen数据集上实现了0.9744的准确率,非常接近先前工作中报告的当前最先进结果0.978。
- 并非所有谱图组合都能提升性能;例如STFT+MFCC和MFCC+CQT的融合结果低于单谱图基线,凸显了特征选择的重要性。
- 标签扩展在LITIS Rouen数据集上并未始终提升性能,表明其有效性取决于数据集的特定类别分布及聚类可分性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。