Skip to main content
QUICK REVIEW

[论文解读] Polyphonic audio tagging with sequentially labelled data using CRNN with learnable gated linear units

Yuanbo Hou, Qiuqiang Kong|arXiv (Cornell University)|Nov 17, 2018
Music and Audio Processing参考文献 15被引用 10
一句话总结

该论文提出一种带有可学习门控线性单元(GLU-CTC)的CRNN,用于使用顺序标注数据(SLD)进行多音音频标记,其中CTC损失将帧级预测映射到剪辑级标签。该方法实现了0.882的AUC,优于基线CRNN(0.837)、GLU-GMP(0.803)和GLU-GAP(0.766),证明了其在序列建模和标签映射能力方面的优越性。

ABSTRACT

Audio tagging aims to detect the types of sound events occurring in an audio recording. To tag the polyphonic audio recordings, we propose to use Connectionist Temporal Classification (CTC) loss function on the top of Convolutional Recurrent Neural Network (CRNN) with learnable Gated Linear Units (GLU-CTC), based on a new type of audio label data: Sequentially Labelled Data (SLD). In GLU-CTC, CTC objective function maps the frame-level probability of labels to clip-level probability of labels. To compare the mapping ability of GLU-CTC for sound events, we train a CRNN with GLU based on Global Max Pooling (GLU-GMP) and a CRNN with GLU based on Global Average Pooling (GLU-GAP). And we also compare the proposed GLU-CTC system with the baseline system, which is a CRNN trained using CTC loss function without GLU. The experiments show that the GLU-CTC achieves an Area Under Curve (AUC) score of 0.882 in audio tagging, outperforming the GLU-GMP of 0.803, GLU-GAP of 0.766 and baseline system of 0.837. That means based on the same CRNN model with GLU, the performance of CTC mapping is better than the GMP and GAP mapping. Given both based on the CTC mapping, the CRNN with GLU outperforms the CRNN without GLU.

研究动机与目标

  • 为解决录音中重叠声音事件带来的多音音频标记挑战。
  • 利用顺序标注数据(SLD),其中每个音频剪辑按时间顺序包含多个事件标签。
  • 通过CTC损失改进从帧级预测到剪辑级事件检测的标签映射。
  • 评估可学习门控线性单元(GLU)在提升CRNN音频标记性能方面的有效性。

提出的方法

  • 提出一种带有可学习门控线性单元(GLU)的CRNN架构,以建模音频序列中的时间依赖性。
  • 应用联结时序分类(CTC)损失,将帧级标签概率映射到剪辑级事件检测。
  • 使用顺序标注数据(SLD),其中每个音频剪辑按时间顺序标注了多个声音事件序列。
  • 将GLU-CTC与使用全局最大池化(GLU-GMP)和全局平均池化(GLU-GAP)的CRNN变体进行比较,以实现从帧到剪辑的映射。
  • 使用CTC损失进行模型训练,以处理可变长度的标签序列和帧级预测。
  • 在DCASE2018音频标记基准上,使用曲线下面积(AUC)评估性能。

实验结果

研究问题

  • RQ1与GMP和GAP等全局池化方法相比,基于CTC的标签映射是否能提升多音音频标记性能?
  • RQ2可学习门控线性单元(GLU)的引入是否增强了CRNN在多音场景下建模复杂音频序列的能力?
  • RQ3与使用CTC损失的标准CRNN相比,GLU-CTC模型在顺序标注数据(SLD)上的表现如何?
  • RQ4在音频标记中,CTC损失函数是否比全局池化更有效地将帧级预测聚合为剪辑级标签?
  • RQ5GLU和CTC损失在提升多音音频标记AUC性能方面的相对贡献是什么?

主要发现

  • GLU-CTC模型实现了0.882的AUC,显著优于基线CRNN加CTC(0.837)。
  • GLU-CTC优于GLU-GMP(0.803)和GLU-GAP(0.766),表明基于CTC的映射在标签聚合方面比全局池化更有效。
  • 即使使用相同的CTC损失,引入可学习门控线性单元(GLU)也提升了性能,优于未使用GLU的标准CRNN。
  • CTC损失函数能够更好地建模多音音频中的时间关系,尤其在重叠和序列性声音事件中表现更优。
  • 结果证实,GLU和CTC损失在提升SLD上的音频标记性能方面具有协同增效作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。