Skip to main content
QUICK REVIEW

[论文解读] Attention and Localization based on a Deep Convolutional Recurrent Model for Weakly Supervised Audio Tagging

Yong Xu, Qiuqiang Kong|arXiv (Cornell University)|Mar 17, 2017
Music and Audio Processing参考文献 25被引用 7
一句话总结

本文提出一种弱监督的深度卷积循环模型,结合注意力与定位模块,仅使用片段级标签进行音频标记。通过利用注意力机制突出相关帧,并引入专门的定位模块,该方法在DCASE 2016任务4评估集上将等错误率(EER)从0.13降低至0.11,实现了无需帧级标注的事件定位,达到当前最优性能。

ABSTRACT

Audio tagging aims to perform multi-label classification on audio chunks and it is a newly proposed task in the Detection and Classification of Acoustic Scenes and Events 2016 (DCASE 2016) challenge. This task encourages research efforts to better analyze and understand the content of the huge amounts of audio data on the web. The difficulty in audio tagging is that it only has a chunk-level label without a frame-level label. This paper presents a weakly supervised method to not only predict the tags but also indicate the temporal locations of the occurred acoustic events. The attention scheme is found to be effective in identifying the important frames while ignoring the unrelated frames. The proposed framework is a deep convolutional recurrent model with two auxiliary modules: an attention module and a localization module. The proposed algorithm was evaluated on the Task 4 of DCASE 2016 challenge. State-of-the-art performance was achieved on the evaluation set with equal error rate (EER) reduced from 0.13 to 0.11, compared with the convolutional recurrent baseline system.

研究动机与目标

  • 解决仅具备片段级标签而无帧级标注的音频标记挑战。
  • 在无需帧级监督的情况下,实现在音频片段中对声学事件进行时间定位。
  • 通过注意力机制聚焦相关音频段,提升音频标记的鲁棒性与准确性。
  • 构建一种弱监督学习框架,仅通过片段级标签端到端训练,推断事件位置。
  • 展示在卷积门控循环神经网络(CGRNN)架构中,结合注意力与定位模块的有效性。

提出的方法

  • 采用片段级卷积门控循环神经网络(CGRNN)作为主干网络,用于特征提取与序列建模。
  • 集成注意力模块,利用Sigmoid激活函数对帧级特征施加可学习权重,突出重要帧并抑制噪声。
  • 实现包含七个输出节点的定位模块,每个节点对应一个音频事件标签,用于预测时间事件位置。
  • 仅使用片段级标签进行端到端训练,使系统能够通过弱监督推断潜在的帧级事件位置。
  • 使用50%重叠的帧作为模型输入,以保持时间连续性并提升定位精度。
  • 在CNN层中应用ReLU激活函数并结合最大池化操作,以实现鲁棒的特征学习,随后使用双向GRU进行序列建模。

实验结果

研究问题

  • RQ1当仅提供片段级标签时,注意力机制能否有效识别用于事件检测的相关音频帧?
  • RQ2弱监督深度学习模型能否在无帧级标注的情况下对音频片段中的声学事件进行定位?
  • RQ3所提出的注意力与定位框架相较于基线模型,在音频标记性能与定位准确性方面表现如何?
  • RQ4注意力机制在弱监督音频标记中,对背景噪声与无关片段的鲁棒性提升程度如何?
  • RQ5模型定位事件的能力是否与在频繁事件(如“儿童说话”)上的性能提升相关?

主要发现

  • 所提出的ATT-LOC方法在DCASE 2016评估集上实现了平均等错误率(EER)0.11,相较于基线CGRNN模型的0.13有显著降低。
  • 该方法在“儿童说话”事件上性能显著提升,开发集上EER从0.17降至0.09,评估集上从0.21降至0.09。
  • 注意力权重有效突出了相关段落(如“儿童说话”和“敲击声”),同时抑制了无关帧,所有注意力值均超过0.5。
  • 定位模块成功识别出单个音频片段中多个“敲击声”和“儿童说话”事件实例,经光谱图与预测输出的可视化验证确认。
  • 模型通过聚焦显著事件段落,表现出对背景噪声的鲁棒性,即使仅使用片段级标签进行训练亦能实现。
  • 该框架实现了弱监督定位,即仅从片段级标签即可推断帧级事件位置,对实际应用中帧级标注成本高昂的场景具有重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。