Skip to main content
QUICK REVIEW

[论文解读] Sound event detection via dilated convolutional recurrent neural networks

Yanxiong Li, Mingle Liu|arXiv (Cornell University)|Nov 25, 2019
Music and Audio Processing参考文献 21被引用 5
一句话总结

本文提出一种空洞卷积循环神经网络(dilated CRNN)用于声音事件检测(SED),通过空洞卷积扩展感受野,从而在不增加模型参数数量的前提下捕捉长程时间依赖关系。与标准CRNN相比,该方法在TUT-SED 2016数据集上实现了最高6.3%的F1分数提升和最高4.1%的错误率降低,通过高效的上下文建模显著提升了SED性能。

ABSTRACT

Convolutional recurrent neural networks (CRNNs) have achieved state-of-the-art performance for sound event detection (SED). In this paper, we propose to use a dilated CRNN, namely a CRNN with a dilated convolutional kernel, as the classifier for the task of SED. We investigate the effectiveness of dilation operations which provide a CRNN with expanded receptive fields to capture long temporal context without increasing the amount of CRNN's parameters. Compared to the classifier of the baseline CRNN, the classifier of the dilated CRNN obtains a maximum increase of 1.9%, 6.3% and 2.5% at F1 score and a maximum decrease of 1.7%, 4.1% and 3.9% at error rate (ER), on the publicly available audio corpora of the TUT-SED Synthetic 2016, the TUT Sound Event 2016 and the TUT Sound Event 2017, respectively.

研究动机与目标

  • 通过增强深度神经网络中的时间上下文建模能力,提升声音事件检测(SED)性能。
  • 解决标准CRNN因感受野受限而难以捕捉长程依赖关系的问题。
  • 探究空洞卷积在不增加模型参数数量的前提下扩展上下文的有效性。
  • 在TUT-SED 2016、2017及Synthetic 2016等标准SED基准数据集上评估所提出的空洞CRNN。
  • 从F1分数和错误率两个方面,对比空洞CRNN与基线CRNN的性能表现。

提出的方法

  • 所提出的模型在循环层之前引入空洞卷积层,以扩展网络的感受野。
  • 在卷积层中应用膨胀率,以在不增加参数数量的前提下扩大有效感受野。
  • 该架构结合卷积层进行局部特征提取,以及双向长短期记忆(BLSTM)层进行序列建模。
  • 空洞卷积使网络能够捕捉对精确声音事件定位至关重要的长期时间依赖关系。
  • 模型采用端到端训练方式,基于弱标注的音频数据(含事件边界)使用交叉熵损失进行优化。
  • 最终的预测头输出每个声音事件类别的帧级概率。

实验结果

研究问题

  • RQ1空洞卷积是否能通过扩展感受野,提升CRNN在声音事件检测中的性能?
  • RQ2使用空洞卷积是否能更好地建模音频序列中的长程时间依赖关系?
  • RQ3在公开的SED数据集上,空洞CRNN与标准CRNN相比,在F1分数和错误率方面表现如何?
  • RQ4空洞CRNN是否能在不增加模型参数数量的前提下保持或提升性能?
  • RQ5膨胀率对不同声音事件检测准确率有何影响?

主要发现

  • 与基线CRNN相比,空洞CRNN在TUT Sound Event 2016数据集上实现了最高6.3%的F1分数提升。
  • 在TUT-SED Synthetic 2016数据集上,模型F1分数提升了1.9%,错误率降低了1.7%。
  • 在TUT Sound Event 2017数据集上,F1分数提升了2.5%,错误率降低了3.9%。
  • 在所有三个基准数据集上性能提升均具有一致性,表明该方法具有良好的泛化能力。
  • 空洞CRNN在不增加模型参数数量的前提下实现上述性能提升,凸显其参数效率。
  • 结果证实,空洞卷积能有效增强SED任务中的时间建模能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。