Skip to main content
QUICK REVIEW

[论文解读] Environmental Sound Classification with Parallel Temporal-spectral Attention

Helin Wang, Yuexian Zou|View|Dec 14, 2019
Music and Audio Processing参考文献 9被引用 8
一句话总结

本文提出了一种用于卷积神经网络(CNN)的并行时频注意力机制,通过分别关注相关的时间帧和频带,以提升环境声音分类性能。通过在并行分支中应用时域和频域注意力,该方法增强了判别性特征学习,在 ESC-10 上实现了 95.8% 的最先进准确率,在 ESC-50 上达到 88.6%,并在多个数据集上表现出更强的抗噪鲁棒性。

ABSTRACT

Convolutional neural networks (CNN) are one of the best-performing neural network architectures for environmental sound classification (ESC). Recently, temporal attention mechanisms have been used in CNN to capture the useful information from the relevant time frames for audio classification, especially for weakly labelled data where the onset and offset times of the sound events are not applied. In these methods, however, the inherent spectral characteristics and variations are not explicitly exploited when obtaining the deep features. In this paper, we propose a novel parallel temporal-spectral attention mechanism for CNN to learn discriminative sound representations, which enhances the temporal and spectral features by capturing the importance of different time frames and frequency bands. Parallel branches are constructed to allow temporal attention and spectral attention to be applied respectively in order to mitigate interference from the segments without the presence of sound events. The experiments on three environmental sound classification (ESC) datasets and two acoustic scene classification (ASC) datasets show that our method improves the classification performance and also exhibits robustness to noise.

研究动机与目标

  • 为解决现有 CNN 注意力机制在环境声音分类任务中的局限性,这些机制通常关注时间动态却忽略频谱变化。
  • 显式建模 spectrogram 中不同频带和时间帧的重要性,以提升特征判别能力。
  • 通过并行架构独立计算注意力,减轻时域与频域特征之间的干扰。
  • 提升模型在噪声环境下的鲁棒性,特别是在未提供声音事件边界(弱标签)场景下。
  • 在环境声音分类(ESC)和声学场景分类(ASC)任务上验证该方法的有效性。

提出的方法

  • 设计了一种并行时频注意力机制,包含两个独立分支:一个用于时域注意力,一个用于频域注意力,均作用于同一特征图。
  • 时域注意力通过全局平均池化和可学习权重向量,在时间帧上计算注意力权重,聚焦于相关的时间段。
  • 频域注意力通过沿时间轴的全局平均池化,在频带方向上计算注意力权重,受人类听觉皮层频带选择性滤波的启发。
  • 通过逐元素乘法将注意力图应用于输入特征图,增强相关时频区域,同时抑制噪声和无关成分。
  • 并行结构可防止时域与频域注意力分支之间的干扰,提升在噪声条件下的稳定性和鲁棒性。
  • 该机制被集成到 CNN 架构(TS-CNN10)中,可应用于任意卷积层,消融实验表明深层网络从该机制中获益最多。

实验结果

研究问题

  • RQ1并行时频注意力机制能否提升 CNN 在环境声音分类任务中的特征表示能力?
  • RQ2分别关注时间帧与频带是否优于联合或顺序注意力机制?
  • RQ3在缺乏声音事件边界信息的条件下,该方法在噪声环境下的表现如何?
  • RQ4该注意力机制能否推广至其他音频分类任务,如声学场景分类?
  • RQ5并行架构是否能减少时域与频域特征学习之间的干扰,从而提升鲁棒性?

主要发现

  • 所提出的 TS-CNN10 模型在 ESC-10 数据集上实现了 95.8% 的最先进准确率,超越人类水平表现。
  • 在 ESC-50 数据集上,该方法达到 88.6% 的准确率,在干净条件下相比基线 CNN10 提升 3.4%。
  • 在噪声条件下,TS-CNN10 展现出显著鲁棒性,在 10 dB 信噪比的高斯噪声下,相比 CNN10 准确率提升 5.4%。
  • 该方法在 DCASE 2018 和 2019 ASC 基准数据集上也提升了性能,证实其在声学场景分类任务中的泛化能力。
  • 可视化结果表明,TS-CNN10 有效抑制了特征图中由噪声激活的区域,同时保留了相关时频区域的激活。
  • 消融实验确认,并行结构优于串联或拼接的注意力变体,且深层网络从该机制中获益最多。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。