Skip to main content
QUICK REVIEW

[论文解读] Acoustic Scene Classification Using Fusion of Attentive Convolutional Neural Networks for DCASE2019 Challenge

Hossein Zeinali, Lukáš Burget|arXiv (Cornell University)|Jul 13, 2019
Music and Audio Processing参考文献 13被引用 6
一句话总结

本论文在DCASE2019挑战赛中提出了一种融合三种注意力卷积神经网络——VGG类、Light-CNN和x-vector——的声学场景分类方法。通过利用自注意力池化以及基于校准分数平均或多数投票的模型集成,该系统在官方验证集上实现了77.0%的平均准确率,显著优于基线模型(62.5%)。

ABSTRACT

In this report, the Brno University of Technology (BUT) team submissions for Task 1 (Acoustic Scene Classification, ASC) of the DCASE-2019 challenge are described. Also, the analysis of different methods is provided. The proposed approach is a fusion of three different Convolutional Neural Network (CNN) topologies. The first one is a VGG like two-dimensional CNNs. The second one is again a two-dimensional CNN network which uses Max-Feature-Map activation and called Light-CNN (LCNN). The third network is a one-dimensional CNN which mainly used for speaker verification and called x-vector topology. All proposed networks use self-attention mechanism for statistic pooling. As a feature, we use a 256-dimensional log Mel-spectrogram. Our submissions are a fusion of several networks trained on 4-folds generated evaluation setup using different fusion strategies.

研究动机与目标

  • 通过为音频表征学习量身定制的深度神经网络,提升声学场景分类性能。
  • 通过设计鲁棒且具备注意力感知能力的架构,解决可变长度音频片段和类别不平衡的问题。
  • 通过在交叉验证划分上训练的多样化CNN拓扑结构进行模型融合,提升泛化能力和鲁棒性。
  • 探究自注意力池化相较于平均池化,在捕捉音频场景中显著时间特征方面的有效性。
  • 在低资源、开放集分类设置下,评估融合策略——校准分数平均与多数投票——在组合多个模型时的效果。

提出的方法

  • 采用256维对数梅尔频谱图作为输入特征,从单通道、去均值的音频信号中通过使用2048点汉明窗和430样本重叠的STFT提取。
  • 训练三种不同的CNN架构:一种具有6个残差块的VGG类2D-CNN,一种采用最大特征图(MFM)激活函数以减少通道维度的Light-CNN,以及一种用于时间嵌入学习的1D-CNN(x-vector结构)。
  • 在池化层中集成自注意力机制,以计算加权均值和标准差,实现对信息丰富时间帧的动态聚焦,而非均匀平均。
  • 使用128帧的随机裁剪(来自512帧的10秒片段)进行训练,以减少过拟合并提升泛化能力。
  • 在开发数据上采用4折交叉验证设置,以实现稳健的模型评估与训练,并基于所有折的输出进行模型融合。
  • 采用两种融合策略:(1) 通过FoCal多分类工具箱(基于逻辑回归的融合)实现校准分数平均;(2) 使用融合分数进行平局打破的预测类别多数投票。

实验结果

研究问题

  • RQ1与传统的平均池化相比,自注意力池化在声学场景分类中如何提升性能?
  • RQ2在多模型集成中,VGG类、Light-CNN和x-vector拓扑结构的相对贡献是什么?
  • RQ3与完整10秒片段训练相比,在较短随机裁剪(128帧)上训练是否能提升泛化能力?
  • RQ4在模型融合中,校准分数平均与多数投票策略在声学场景分类中的有效性如何?
  • RQ5在开发数据上采用4折交叉验证设置,是否能比官方验证集提供更可靠的性能估计?

主要发现

  • 融合系统在DCASE2019官方验证集上实现了77.0%的平均准确率,显著优于基线系统(62.5%)。
  • x-vector拓扑在公园(92.9%)和街道交通(90.6%)场景中取得了最高个体准确率,表明其在高变化环境中的优异表现。
  • Light-CNN和VGG类网络分别在地铁站(75.2%)和公交车(92.7%)场景中表现优异,凸显了架构的专业化特性。
  • 自注意力池化相比平均池化提升了性能,尤其在包含瞬态事件的场景中,通过聚焦于信息丰富的帧实现。
  • 校准分数平均融合策略优于多数投票,尤其在预测结果出现平局时,因其具有更好的分数校准能力。
  • 在128帧随机裁剪上进行训练相比完整片段训练,提升了泛化能力,减少了过拟合并增强了鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。