Skip to main content
QUICK REVIEW

[论文解读] Multi-Temporal Resolution Convolutional Neural Networks for Acoustic Scene Classification

Alexander Schindler, Thomas Lidy|arXiv (Cornell University)|Nov 11, 2018
Music and Audio Processing参考文献 5被引用 7
一句话总结

本文提出一种多时间分辨率卷积神经网络(CNN),用于声学场景分类,通过并行处理不同时间窗口大小的梅尔频谱图,同时捕捉细微的频谱纹理和更广泛的声学事件模式。该模型相较于最佳单分辨率基线模型提升绝对准确率3.56%,相较于DCASE 2017任务基线提升12.49%,通过联合学习多尺度时间表征展现出更优性能。

ABSTRACT

In this paper we present a Deep Neural Network architecture for the task of acoustic scene classification which harnesses information from increasing temporal resolutions of Mel-Spectrogram segments. This architecture is composed of separated parallel Convolutional Neural Networks which learn spectral and temporal representations for each input resolution. The resolutions are chosen to cover fine-grained characteristics of a scene's spectral texture as well as its distribution of acoustic events. The proposed model shows a 3.56% absolute improvement of the best performing single resolution model and 12.49% of the DCASE 2017 Acoustic Scenes Classification task baseline.

研究动机与目标

  • 为解决声学场景分类中选择最优时间窗口大小的挑战,该挑战常导致难以同时捕捉细微的音色细节与更长的声学事件模式。
  • 通过在多个分辨率下联合建模频谱纹理与时间事件动态,提升分类准确率。
  • 探究结合多时间尺度表征是否能增强模型的泛化能力与鲁棒性。
  • 评估数据增强对性能的影响,特别是对易受扰动影响的类别。
  • 确定多分辨率学习是否优于单分辨率模型的集成平均。

提出的方法

  • 该架构采用并行的一维CNN分支,每个分支处理特定时间窗口大小(例如512至8192毫秒)的梅尔频谱图,从而在每个分辨率下独立学习频谱与时间特征。
  • 每个分辨率分支应用卷积与池化层以提取分层表征,最大池化操作在保留关键特征的同时减少空间维度。
  • 将所有分辨率分支的表征进行拼接,并输入全连接层进行最终分类,使模型能够学习跨分辨率的依赖关系。
  • 通过从同一类别中随机混合音频片段的方式实施数据增强,以提升训练数据的多样性并增强鲁棒性。
  • 采用一种自定义的Dropout层,在训练过程中随机丢弃整个分辨率特定的CNN分支,以防止过拟合,尽管标准Dropout(p=0.25)性能表现相当。
  • 训练采用早停策略,耐心为3个周期,并使用余弦退火学习率调度,最小学习率为5×10⁻⁶。

实验结果

研究问题

  • RQ1与单分辨率方法相比,是否在多个时间分辨率下建模声学场景能提升分类准确率?
  • RQ2哪些时间窗口大小最有效地捕捉如音色纹理与事件序列等不同声学场景特征?
  • RQ3结合多分辨率特征是否优于对单个单分辨率模型预测结果的平均?
  • RQ4数据增强对性能有何影响,特别是对'grocery_store'和'city_center'等类别,其性能提升微弱或甚至下降?
  • RQ5不同数据增强策略在特定声学场景类别上对模型性能的退化或提升程度如何?

主要发现

  • 在使用数据增强的情况下,多分辨率模型达到87.29%的准确率,相比最佳单分辨率模型(83.73%)提升3.56个百分点的绝对准确率。
  • 该模型相比DCASE 2017基线模型提升12.49%,准确率达到87.29%,而基线模型为74.80%。
  • 表现最佳的单分辨率模型使用8192毫秒窗口,准确率达到83.73%(使用增强),而多分辨率模型进一步超越该结果,达到87.29%。
  • 较低的时间分辨率(如512毫秒)表现优于较高分辨率,可能是因为频谱图中更清晰的峰值模式有助于特征学习。
  • 数据增强显著提升了大多数类别的性能,但在'car'、'grocery_store'和'city_center'类别上效果中性或略有下降,表明这些类别对音色与时间扰动较为敏感。
  • 对单分辨率模型预测结果进行平均('grouped single')仅达到83.19%的准确率,低于多分辨率模型的87.29%,表明跨分辨率的联合学习比模型集成平均更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。