Skip to main content
QUICK REVIEW

[论文解读] Deep Convolutional Neural Network with Mixup for Environmental Sound Classification

Zhichao Zhang, Shugong Xu|arXiv (Cornell University)|Aug 25, 2018
Music and Audio Processing参考文献 21被引用 5
一句话总结

本文提出一种结合mixup数据增强的深度1D卷积神经网络,用于环境声音分类。通过将标准的3×3卷积核替换为1D卷积以更好地捕捉时间与频谱模式,并应用mixup提升泛化能力,该模型在UrbanSound8K数据集上达到83.7%的最先进性能,在ESC-50和ESC-10上也取得具有竞争力的结果。

ABSTRACT

Environmental sound classification (ESC) is an important and challenging problem. In contrast to speech, sound events have noise-like nature and may be produced by a wide variety of sources. In this paper, we propose to use a novel deep convolutional neural network for ESC tasks. Our network architecture uses stacked convolutional and pooling layers to extract high-level feature representations from spectrogram-like features. Furthermore, we apply mixup to ESC tasks and explore its impacts on classification performance and feature distribution. Experiments were conducted on UrbanSound8K, ESC-50 and ESC-10 datasets. Our experimental results demonstrated that our ESC system has achieved the state-of-the-art performance (83.7%) on UrbanSound8K and competitive performance on ESC-50 and ESC-10.

研究动机与目标

  • 为解决缺乏清晰语言结构的多样化、嘈杂环境声音事件分类挑战。
  • 通过利用更深、可学习的表征,超越传统手工设计特征与浅层模型,提升分类性能。
  • 探究mixup正则化在提升环境声音分类泛化能力与鲁棒性方面的有效性。
  • 设计一种专为频谱图类音频特征优化的新型CNN架构,优于使用3×3卷积核的标准VGG型网络。

提出的方法

  • 提出一种深层1D CNN架构,通过堆叠1D卷积与池化层,从对数梅尔频谱图中提取分层的时间-频谱特征。
  • 将标准的3×3卷积核替换为1D卷积核,以更好地建模时间与频率维度上的局部模式。
  • 通过将一对音频样本及其对应标签的凸组合构造训练样本,应用mixup数据增强。
  • 使用超参数α控制混合比例,所有数据集上最优性能均在α=0.2时取得。
  • 采用全局平均池化与全连接层进行分类,训练过程通过交叉熵损失进行优化。
  • 使用主成分分析(PCA)可视化特征分布,分析mixup对类间与类内可分性的影响。

实验结果

研究问题

  • RQ1与标准VGG型架构相比,将3×3卷积核替换为1D卷积是否能提升环境声音分类性能?
  • RQ2mixup数据增强对环境声音数据集的分类准确率与特征空间分布有何影响?
  • RQ3在多个基准数据集上,环境声音分类的最优mixup超参数α是多少?
  • RQ4mixup能否减少类似声音类别之间的混淆,如电钻与冲击钻、发动机怠速与警报声?
  • RQ5尽管某些类别对可能受到负面影响,mixup是否能在不降低特定类别性能的前提下提升泛化能力?

主要发现

  • 所提出的1D CNN在相同深度下优于VGG型网络,在ESC-10上达到88.7%,ESC-50上达到76.8%,UrbanSound8K上达到74.7%,而后者分别为87.5%、73.3%和73.2%。
  • 结合mixup与数据增强后,模型在UrbanSound8K上实现83.7%的最先进准确率,超越先前方法。
  • mixup显著降低了如电钻、冲击钻、警报声与空调等嘈杂类别之间的混淆,提升了类间分离度。
  • 通过PCA的特征可视化显示,mixup使类内分布更紧密、更紧凑,类间边界更清晰。
  • 最优的mixup超参数α为0.2,在所有三个数据集上均取得最高准确率:ESC-10为91.7%,ESC-50为83.9%,UrbanSound8K为83.7%。
  • 尽管mixup提升了大多数类别的性能,但其略微增加了某些类别对之间的混淆,特别是电钻与警报声,表明存在类别特定的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。