Skip to main content
QUICK REVIEW

[论文解读] Guided Learning Convolution System for DCASE 2019 Task 4

Liwei Lin, Xiangdong Wang|arXiv (Cornell University)|Sep 11, 2019
Music and Audio Processing参考文献 12被引用 4
一句话总结

本论文提出了一种基于引导学习的卷积神经网络系统,用于在家庭环境中进行弱监督和半监督的声音事件检测,利用弱标签数据和无标签数据。通过整合嵌入级注意力池化、解耦特征学习和自适应中值滤波,该模型在DCASE2019测试集上实现了42.7%的基于事件的F1值,优于挑战赛中所有其他参赛方法。

ABSTRACT

In this paper, we describe in detail the system we submitted to DCASE2019 task 4: sound event detection (SED) in domestic environments. We employ a convolutional neural network (CNN) with an embedding-level attention pooling module to solve it. By considering the interference caused by the co-occurrence of multiple events in the unbalanced dataset, we utilize the disentangled feature to raise the performance of the model. To take advantage of the unlabeled data, we adopt Guided Learning for semi-supervised learning. A group of median filters with adaptive window sizes is utilized in the post-processing of output probabilities of the model. We also analyze the effect of the synthetic data on the performance of the model and finally achieve an event-based F-measure of 45.43% on the validation set and an event-based F-measure of 42.7% on the test set. The system we submitted to the challenge achieves the best performance compared to those of other participates.

研究动机与目标

  • 为解决在家庭环境中使用弱标签和无标签音频数据进行大规模声音事件检测的挑战。
  • 通过解耦特征学习提升在存在重叠声音事件的不平衡数据集上的模型性能。
  • 通过引导学习框架有效结合弱监督和半监督学习。
  • 开发一种自适应后处理方法,基于事件持续时间特征提升边界检测精度。
  • 评估强标注合成训练集对模型泛化能力和性能的影响。

提出的方法

  • 使用带有嵌入级注意力池化的CNN模型,从高层特征生成片段级和帧级预测,实现弱监督学习。
  • 注意力机制通过可学习向量和偏置计算帧级权重,使模型能够聚焦于每个事件类的关键音频帧。
  • 应用解耦特征学习以减少共现事件的干扰,提升多事件场景下的鲁棒性。
  • 采用引导学习进行半监督训练,利用无标签数据提升泛化能力。
  • 对输出概率应用具有可变窗口大小的自适应中值滤波,基于事件持续时间优化边界检测。
  • 将合成训练集视为弱标签数据,并通过消融研究评估其对性能的影响。

实验结果

研究问题

  • RQ1深度学习模型如何在无时间戳标注的情况下,有效从弱标签音频数据中学习?
  • RQ2如何在存在重叠声音事件的不平衡数据集上提升模型性能?
  • RQ3引导学习能否有效结合弱标签和无标签数据,以提升半监督SED的性能?
  • RQ4基于事件持续时间差异的自适应后处理(中值滤波)是否能提升不同持续时间事件的边界检测精度?
  • RQ5包含强标注的合成训练集是否能提升弱监督或半监督设置下的性能?

主要发现

  • 所提出的系统在DCASE2019测试集上实现了42.7%的基于事件的F1值,获得挑战赛第一名。
  • 前6名模型的集成(Ensemble Top1-6)相比基线模型性能提升了21.73个百分点。
  • 使用引导学习结合弱标签和无标签数据的模型,相比仅使用弱标签数据的模型,性能提升了20.67个百分点。
  • 在仅弱监督学习中,合成训练集未带来帮助,但当与半监督学习结合时,F1值显著提升5–8个百分点。
  • 移除解耦特征学习或固定窗口中值滤波会降低性能,证实了二者有效性。
  • 该模型在YouTube数据集上表现最佳,但在Vimeo数据集上表现较差,提示可能需要通过音高偏移等数据增强方法提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。