Skip to main content
QUICK REVIEW

[论文解读] Training sound event detection with soft labels from crowdsourced annotations

Irene Martín-Morató, Manu Harju|arXiv (Cornell University)|Feb 28, 2023
Music and Audio Processing被引用 4
一句话总结

本文提出使用来自众包标注的软标签来训练声音事件检测(SED)系统,这些软标签编码了标注者不确定性和共识信息。通过利用这些软标签——基于多个标注者的胜任度加权聚合计算得出——模型能够学习检测在标准硬标签训练中被忽略的低频声音类别,通过类别特定的阈值设定实现对罕见事件的改进检测,其中使用均方误差(MSE)损失和软标签监督时性能最佳。

ABSTRACT

In this paper, we study the use of soft labels to train a system for sound event detection (SED). Soft labels can result from annotations which account for human uncertainty about categories, or emerge as a natural representation of multiple opinions in annotation. Converting annotations to hard labels results in unambiguous categories for training, at the cost of losing the details about the labels distribution. This work investigates how soft labels can be used, and what benefits they bring in training a SED system. The results show that the system is capable of learning information about the activity of the sounds which is reflected in the soft labels and is able to detect sounds that are missed in the typical binary target training setup. We also release a new dataset produced through crowdsourcing, containing temporally strong labels for sound events in real-life recordings, with both soft and hard labels.

研究动机与目标

  • 为解决大规模、长时长、强标签 SED 数据集稀缺的问题,创建一个包含时间上强标签的新数据集。
  • 探究软标签(反映标注者不确定性和共识)是否相比传统硬标签能提升 SED 模型性能。
  • 评估在使用软标签进行 SED 时,不同训练目标(BCE 与 MSE)的有效性。
  • 证明软标签监督能够实现对在标准硬标签训练中被忽略的低频声音类别的检测。
  • 探索类别特定的阈值设定策略,以更好地使模型输出与软标签分布对齐。

提出的方法

  • 通过重叠的弱标签片段收集众包标注,标注者指示预定义声音事件的存在/不存在。
  • 通过使用 MACE 估计的胜任度对多位标注者的意见进行聚合,计算出介于 0 到 1 之间的活动得分,生成软标签。
  • 发布了一个新数据集 MAESTRO-Real,包含 5 个真实生活声学场景、17 个声音类别,以及软标签和硬标签。
  • 使用二元交叉熵(BCE)和均方误差(MSE)损失函数,结合软标签对 SED 模型进行训练。
  • 系统输出通过与硬标签对比的 1 秒段 F1 分数和误差率(ER),以及与软标签对比的 Kullback-Leibler 散度(KLD)进行评估。
  • 通过每类使用 10% 截尾中位数阈值,分析类别级性能,以优化罕见事件检测的敏感度。

实验结果

研究问题

  • RQ1与硬标签相比,来自众包标注的软标签是否能提升声音事件检测性能?
  • RQ2使用软标签训练是否能检测到在标准硬标签训练设置中被忽略的低频声音类别?
  • RQ3不同的损失函数(BCE 与 MSE)在 SED 中与软标签监督的交互作用如何?
  • RQ4软预测与软参考之间的 KLD 在多大程度上反映了模型校准和不确定性建模?
  • RQ5在使用软标签监督时,类别特定的阈值设定是否能改善罕见事件的检测?

主要发现

  • 使用软标签训练的 S_MSE_lin 模型在微平均 F1 分数(70.82%)最高,且与软参考的 KLD 最低(1.383),表明其与软标签分布对齐最佳。
  • 使用硬标签和 BCE 损失训练的 H_BCE_sig 模型,由于训练目标中类别不平衡,未能检测到低频类别。
  • 使用 MSE 损失的软标签训练能够检测所有声音类别,即使其软标签值低于 0.5,而固定 0.5 阈值设定时这些类别会被遗漏。
  • 基于软标签 10% 截尾中位数的类别依赖阈值显著提升了类别级 F1 分数,尽管整体 ER(0.47)和 F1(67.30%)相比最佳硬标签模型略有上升。
  • KLD 指标证实,S_MSE_lin 模型的软输出最接近参考软标签,表明其具备有效的不确定性建模能力。
  • 发布包含软标签和硬标签的 MAESTRO-Real 数据集,为未来使用不确定性感知标注的 SED 研究提供了宝贵基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。