Skip to main content
QUICK REVIEW

[论文解读] Multi-stream Network With Temporal Attention For Environmental Sound Classification

Xinyu Li, Venkata Chebiyyam|arXiv (Cornell University)|Jan 24, 2019
Music and Audio Processing参考文献 16被引用 11
一句话总结

该论文提出一种带有时间注意力机制的多流卷积神经网络,用于环境声音分类,通过原始音频、STFT和差分谱图输入,提升在多样化音频信号上的鲁棒性。该方法在ESC-10、DCASE和ESC-50数据集上实现了最先进性能,且无需架构或预处理改动,利用时间注意力机制定位关键特征,并通过不确定性决策融合提升泛化能力。

ABSTRACT

Environmental sound classification systems often do not perform robustly across different sound classification tasks and audio signals of varying temporal structures. We introduce a multi-stream convolutional neural network with temporal attention that addresses these problems. The network relies on three input streams consisting of raw audio and spectral features and utilizes a temporal attention function computed from energy changes over time. Training and classification utilizes decision fusion and data augmentation techniques that incorporate uncertainty. We evaluate this network on three commonly used data sets for environmental sound and audio scene classification and achieve new state-of-the-art performance without any changes in network architecture or front-end preprocessing, thus demonstrating better generalizability.

研究动机与目标

  • 解决环境声音分类(ESC)模型在不同数据集之间泛化能力差的问题,以及在可变时间结构下的表现不佳。
  • 提升模型在具有高度可变时长和时间动态的音频信号上的鲁棒性,如短时脉冲(如水滴声)或长时间连续声音(如海浪声)。
  • 开发一种统一的深度学习框架,在无需特定数据集的架构或特征工程的情况下,于多样化ESC基准上表现良好。
  • 通过一种新颖的时间注意力机制,同步与CNN层处理,实现对时间维度上判别性特征的定位。
  • 通过不确定性决策融合与数据增强,提升性能与泛化能力,尤其在训练数据有限的情况下。

提出的方法

  • 模型采用三流架构:原始波形、短时傅里叶变换(STFT)谱图(3种分辨率:32、128、1024点FFT)以及差分谱图,所有输入在空间上对齐至512×384维度。
  • 每一流由带有批量归一化和ReLU激活的2D-CNN处理,使用3×3卷积核;同时采用1D-CNN并辅以大步长以降低维度,提升处理速度。
  • 在所有流上应用时间注意力机制,基于时间上的能量变化计算注意力权重,以突出相关的时间段并抑制背景噪声。
  • 注意力机制与CNN层同步计算,实现在特征学习过程中动态加权特征,而非事后处理。
  • 在流之间应用不确定性决策融合,结合预测结果与置信度估计,以提升鲁棒性并减少过拟合。
  • 训练期间及决策融合阶段使用噪声注入进行数据增强,进一步提升泛化能力,尤其在小样本数据集上。

实验结果

研究问题

  • RQ1是否可通过共享架构与基础音频表示(波形、STFT、差分谱图)的多流CNN,在具有可变时间结构的多样化环境声音数据集上实现良好泛化?
  • RQ2一种能随时间能量变化自适应的时间注意力机制,在定位可变长度音频信号中的判别性特征方面效果如何?
  • RQ3在低数据量场景下,不确定性决策融合在提升泛化能力与鲁棒性方面有多大作用?
  • RQ4在决策融合阶段进行数据增强是否能进一步提升性能并减少小样本数据下的过拟合?
  • RQ5各组件——输入流、注意力机制、融合策略与数据增强——对整体性能提升的贡献程度如何?

主要发现

  • 所提模型在所有三个基准数据集上均达到最先进性能:ESC-10准确率达94.2%,DCASE达88.2%,ESC-50达84.0%,优于先前方法,且无需架构或预处理改动。
  • 三流输入配置(原始音频、STFT、差分谱图)性能最高,消融实验表明,移除任一流均导致准确率下降10–15%。
  • 时间注意力机制在所有数据集上使准确率提升2.0–2.5个百分点,证明其在定位关键时间事件方面的有效性。
  • 与单流或非不确定性融合相比,不确定性决策融合使准确率提升约2.5%。
  • 在决策融合阶段加入噪声增强带来额外1%的性能增益,证实其在防止小样本数据集过拟合中的必要性。
  • 模型在跨数据集泛化方面表现良好:在DCASE数据集上优于使用视频-音频预训练模型(如SoundNet)的模型,且仅使用音频输入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。