Skip to main content
QUICK REVIEW

[论文解读] Large-scale weakly supervised audio classification using gated convolutional neural network

Yong Xu, Qiuqiang Kong|View|Oct 1, 2017
Music and Audio Processing参考文献 13被引用 13
一句话总结

该论文提出了一种带有时间注意力机制的门控卷积循环神经网络(Gated-CRNN),用于大规模弱监督音频分类,采用对数梅尔频谱图和可学习门控线性单元(GLUs)动态关注相关音频特征。该方法在 DCASE 2017 音频标记子任务中获得第一名(F1:55.6%),在弱监督声音事件检测任务中获得第二名(错误率相等:0.73),在未提供时间戳事件标注的 YouTube 音频弱标签数据上展现出卓越性能。

ABSTRACT

In this paper, we present a gated convolutional neural network and a temporal attention-based localization method for audio classification, which won the 1st place in the large-scale weakly supervised sound event detection task of Detection and Classification of Acoustic Scenes and Events (DCASE) 2017 challenge. The audio clips in this task, which are extracted from YouTube videos, are manually labeled with one or a few audio tags but without timestamps of the audio events, which is called as weakly labeled data. Two sub-tasks are defined in this challenge including audio tagging and sound event detection using this weakly labeled data. A convolutional recurrent neural network (CRNN) with learnable gated linear units (GLUs) non-linearity applied on the log Mel spectrogram is proposed. In addition, a temporal attention method is proposed along the frames to predicate the locations of each audio event in a chunk from the weakly labeled data. We ranked the 1st and the 2nd as a team in these two sub-tasks of DCASE 2017 challenge with F value 55.6\% and Equal error 0.73, respectively.

研究动机与目标

  • 解决使用弱标签数据进行大规模音频分类的挑战,其中仅提供音频标签而无时间事件边界。
  • 通过引入可学习注意力机制,克服标准 CNN 和 RNN 在关注短时长音频事件方面的局限性。
  • 开发一种统一的深度学习框架,联合执行音频标记与弱监督声音事件检测,无需时间戳标注。
  • 通过将门控线性单元(GLUs)和时间注意力模块集成到 CRNN 架构中,提升特征表示与定位精度。

提出的方法

  • 在卷积层中用可学习门控线性单元(GLUs)替代 ReLU 激活函数,以实现基于目标音频事件相关性的动态、注意力式特征选择。
  • 将原始音频波形转换为对数梅尔频谱图,然后输入由三个门控卷积块组成的堆叠结构,每个块包含 64 个滤波器和 3×3 卷积核大小。
  • 根据任务(音频标记 vs. SED)选择 2×2 或 1×2 卷积核大小进行最大池化操作,随后接入具有 128 个单元的双向门控循环网络(Bi-GRU),以建模长程时间依赖性。
  • 引入一种时间注意力机制,通过在帧之间生成注意力权重,实现在音频片段内定位声音事件,从而在无真实时间戳的情况下实现弱监督检测。
  • 使用二元交叉熵损失函数和 Adam 优化器进行模型训练,并应用小批量数据平衡策略以改善类别不平衡下的性能表现。
  • 融合在对数梅尔频谱图和 MFCC 特征上训练的 Gated-CRNN 模型,提升了泛化能力,在两个子任务上均取得 SOTA 结果。

实验结果

研究问题

  • RQ1可学习门控线性单元(GLUs)是否能通过选择性关注与目标音频事件相关的时频单元,改善音频分类中的特征表示?
  • RQ2一个统一的深度学习模型是否能仅依赖音频标签而无需时间标注,有效同时完成音频标记与弱监督声音事件检测?
  • RQ3在循环层之后应用的时间注意力机制是否能提升弱标签数据中短时音频事件的定位精度?
  • RQ4与基线模型相比,所提出的 Gated-CRNN 在 DCASE 2017 挑战赛中的 F1 分数与错误率表现如何?

主要发现

  • 所提出的 Gated-CRNN 搭配对数梅尔频谱图在音频标记子任务的验证集上取得了 55.6% 的 F1 分数,在 DCASE 2017 挑战赛中排名第一。
  • 在对数梅尔频谱图和 MFCC 特征上分别训练的 Gated-CRNN 模型进行融合后,在音频标记任务上达到了 57.7% 的 F1 分数,比第二名系统高出 3 个百分点。
  • 在弱监督声音事件检测任务中,Gated-CRNN 系统实现了 0.73 的错误率相等(EER)和 51.8% 的 F1 分数,在参赛队伍中排名第二。
  • 时间注意力机制成功高精度定位了如“火车”和“火车鸣笛”等声音事件,尽管在短片段中出现了少量误报。
  • 小批量数据平衡策略显著提升了 F1、精确率与召回率,证明其在处理弱标签音频数据中类别不平衡问题时的重要性。
  • 在 SED 子任务中,该模型相比 DCASE 2017 基线模型(F1:28.4%)提升了超过 20 个百分点,证实了所提出架构与注意力机制的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。