Skip to main content
QUICK REVIEW

[论文解读] Attention based Convolutional Recurrent Neural Network for Environmental Sound Classification

Zhichao Zhang, Shugong Xu|arXiv (Cornell University)|Jul 4, 2019
Music and Audio Processing参考文献 25被引用 10
一句话总结

本文提出了一种基于注意力机制的卷积循环神经网络(ACRNN),用于环境声音分类,通过将帧级注意力与CNN-RNN架构相结合,聚焦于语义相关且显著的帧。该方法在ESC-10数据集上实现了93.7%的最先进准确率,在ESC-50数据集上实现了86.1%的最先进准确率,显著优于先前模型,通过注意力机制有效过滤了静音和无关帧。

ABSTRACT

Environmental sound classification (ESC) is a challenging problem due to the complexity of sounds. The ESC performance is heavily dependent on the effectiveness of representative features extracted from the environmental sounds. However, ESC often suffers from the semantically irrelevant frames and silent frames. In order to deal with this, we employ a frame-level attention model to focus on the semantically relevant frames and salient frames. Specifically, we first propose an convolutional recurrent neural network to learn spectro-temporal features and temporal correlations. Then, we extend our convolutional RNN model with a frame-level attention mechanism to learn discriminative feature representations for ESC. Experiments were conducted on ESC-50 and ESC-10 datasets. Experimental results demonstrated the effectiveness of the proposed method and achieved the state-of-the-art performance in terms of classification accuracy.

研究动机与目标

  • 为解决环境声音分类中静音和语义无关帧的挑战。
  • 通过将帧级注意力整合到CNN-RNN架构中,改善特征表示。
  • 仅使用频谱图特征,不融合原始音频,实现在公开ESC数据集上的最先进性能。
  • 探究在神经网络架构中应用注意力的最优层。

提出的方法

  • 模型使用对数Gammatone频谱图作为输入,通过STFT和128通道Gammatone滤波器组提取。
  • 设计了一个卷积循环神经网络(CRNN),包含两层1D卷积层,后接双向GRU,以捕捉频谱-时间特征和序列特征。
  • 应用帧级注意力机制,选择性地强调相关帧,其计算基于GRU的隐藏状态。
  • 在多个层(l2、l4、l6、l8、l10)评估注意力机制,发现在最终RNN层(l10)应用时性能最高。
  • 通过时间拉伸、音高偏移和mixup进行数据增强,以提升泛化能力和鲁棒性。
  • 最终架构结合了CNN特征提取、双向GRU时序建模以及端到端可训练的注意力帧选择机制。

实验结果

研究问题

  • RQ1在神经网络架构的哪个位置应用帧级注意力能带来最高的性能提升?
  • RQ2注意力机制能否有效抑制环境声音分类中的静音和无关帧?
  • RQ3与标准CRNN相比,将注意力机制同时集成到CNN和RNN层是否能提升分类准确率?
  • RQ4所提出的ACRNN与使用原始音频或多流特征的最先进模型相比表现如何?

主要发现

  • ACRNN在ESC-10数据集上实现了93.7%的最先进分类准确率,在ESC-50数据集上实现了86.1%的最先进分类准确率,优于现有模型。
  • 在最终RNN层(l10)应用注意力机制时性能最高,在ESC-10上相比无注意力机制提升了0.7%的绝对准确率,在ESC-50上提升了1.5%。
  • 即使结合数据增强,注意力机制仍能提升性能,显示出在过滤无关帧方面的鲁棒性和有效性。
  • 该模型仅使用频谱图特征即取得优越结果,而WaveMsNet和Multi-Stream CNN等模型需融合原始音频与频谱图输入。
  • 混淆矩阵分析显示,教堂钟声的分类准确率高达100%,而直升机的准确率较低(52.5%),主要因与飞机声音在声学上相似导致误分类。
  • 在早期CNN层(如l2)应用注意力也能略微提升性能,但效果不如在RNN层应用显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。