Skip to main content
QUICK REVIEW

[论文解读] Training Sound Event Detection On A Heterogeneous Dataset

Nicolas Turpault, Romain Serizel|arXiv (Cornell University)|Jul 8, 2020
Music and Audio Processing参考文献 23被引用 10
一句话总结

本文对 DCASE 2020 任务 4 的声音事件检测(SED)基线模型进行了全面的消融研究,分析了数据构成、数据增强(音高偏移、混响)、均值教师超参数以及噪声注入的影响。研究发现默认设置存在次优问题,尤其是在噪声水平和混响应用方面,并证明通过优化配置,新模型在验证集和公开评估集上的性能相比原始基线最高提升了 3%。

ABSTRACT

Training a sound event detection algorithm on a heterogeneous dataset including both recorded and synthetic soundscapes that can have various labeling granularity is a non-trivial task that can lead to systems requiring several technical choices. These technical choices are often passed from one system to another without being questioned. We propose to perform a detailed analysis of DCASE 2020 task 4 sound event detection baseline with regards to several aspects such as the type of data used for training, the parameters of the mean-teacher or the transformations applied while generating the synthetic soundscapes. Some of the parameters that are usually used as default are shown to be sub-optimal.

研究动机与目标

  • 批判性评估在异构数据集(包括合成与真实声景)上训练的 SED 系统中的默认技术选择。
  • 研究数据增强技术(如音高偏移和混响)对 SED 性能的影响。
  • 分析均值教师训练组件(包括噪声注入和一致性损失加权)的作用。
  • 确定均值教师框架的最优超参数,特别是训练率与损失加权的预热策略。
  • 通过系统的消融研究改进 DCASE 2020 任务 4 基线,构建出性能更优、经实证验证的 SED 系统。

提出的方法

  • 采用具有 CRNN 架构的均值教师模型,其中学生模型在弱标签真实声景和强标签合成声景上进行训练,而教师模型提供一致性正则化。
  • 对合成数据使用帧级二元交叉熵损失,对弱标签真实数据使用片段级二元交叉熵损失。
  • 使用指数移动平均更新教师权重,并在教师分支中引入高斯噪声以提升鲁棒性。
  • 通过 FUSS 数据集中的混响脉冲响应(RIR)实现音高偏移与混响的数据增强,以提升合成声景的多样性与真实感。
  • 对均值教师分支中的信噪比(SNR)、一致性损失加权以及学习率与损失加权的预热策略进行消融研究。
  • 在不同配置下于验证集和公开评估集上评估性能,以隔离各组件的影响。

实验结果

研究问题

  • RQ1不同的数据构成比例(合成数据、弱标签数据、无标签数据)如何影响 SED 性能?
  • RQ2在合成声景中对孤立声音事件应用音高偏移,对下游 SED 准确率有何影响?
  • RQ3使用 FUSS 数据集中的 RIR 进行混响处理是否能提升 SED 通用性?在何种条件下表现最佳?
  • RQ4在均值教师分支中添加噪声的信噪比(SNR)如何影响模型鲁棒性与性能?
  • RQ5在均值教师框架中,一致性损失加权与学习率预热的最优配置是什么?

主要发现

  • 对合成数据中的孤立声音事件应用音高偏移可提升 SED 性能,交叉验证 F1 得分为 35.91%,高于未使用音高偏移时的 34.14%。
  • 仅在训练阶段应用 FUSS 数据集中的 RIR 混响可提升验证集性能,但若在训练和验证阶段均应用则导致性能下降。
  • 从均值教师分支中移除加性噪声可提升性能,表明现有的 Dropout 机制已提供足够的正则化。
  • 对一致性损失加权与学习率均实施预热策略可获得最佳性能,验证集 PSDS 得分为 0.502。
  • 将一致性损失权重从 1 提升至 2 可提升性能,当结合音高偏移与最优损失调度时,F1 得分达到最佳值 35.91%。
  • 最终优化后的系统在验证集和公开评估集上相比原始 DCASE 2020 任务 4 基线最高提升 3%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。