Skip to main content
QUICK REVIEW

[论文解读] SeCoST: Sequential Co-Supervision for Weakly Labeled Audio Event Detection

Anurag Kumar, Vamsi Krishna Ithapu|arXiv (Cornell University)|Oct 25, 2019
Music and Audio Processing参考文献 19被引用 7
一句话总结

SeCoST 提出了一种序列协同监督框架,通过级联的学生-教师对之间的知识蒸馏,提升弱监督音频事件检测性能。通过在 AudioSet 的弱标签数据上迭代优化模型,SeCoST 实现了 0.383 的平均平均精度(mAP),显著优于先前的最先进方法。

ABSTRACT

Weakly supervised learning algorithms are critical for scaling audio event detection to several hundreds of sound categories. Such learning models should not only disambiguate sound events efficiently with minimal class-specific annotation but also be robust to label noise, which is more apparent with weak labels instead of strong annotations. In this work, we propose a new framework for designing learning models with weak supervision by bridging ideas from sequential learning and knowledge distillation. We refer to the proposed methodology as SeCoST (pronounced Sequest) --- Sequential Co-supervision for training generations of Students. SeCoST incrementally builds a cascade of student-teacher pairs via a novel knowledge transfer method. Our evaluations on Audioset (the largest weakly labeled dataset available) show that SeCoST achieves a mean average precision of 0.383 while outperforming prior state of the art by a considerable margin.

研究动机与目标

  • 解决在仅使用极少人工标注数据的情况下,将音频事件检测扩展至数百种声音类别的挑战。
  • 相比强监督方法,提升对弱标签数据集中固有标签噪声的鲁棒性。
  • 设计一种训练框架,通过级联的学生-教师知识迁移逐步提升模型性能。
  • 仅使用弱标签监督,有效区分重叠或模糊的音频事件。
  • 仅使用弱标签,在大规模 Audioset 数据集上实现最先进性能。

提出的方法

  • 引入一种序列协同监督机制,利用逐步优化的教师模型蒸馏的知识,训练一系列级联的学生模型。
  • 应用一种新颖的知识迁移方法,对齐学生与教师网络的预测,以在弱监督下提升泛化能力。
  • 利用音频序列的时间结构引导协同监督,提升音频事件的时间定位能力。
  • 使用 AudioSet 中仅提供片段级别标签的弱标签数据,端到端训练模型。
  • 通过使用前序教师模型的预测作为软监督信号,迭代优化学生模型。
  • 采用基于置信度的过滤和一致性正则化,降低训练过程中噪声弱标签的影响。

实验结果

研究问题

  • RQ1与标准弱监督基线相比,序列协同监督结合知识蒸馏是否能提升弱监督音频事件检测的性能?
  • RQ2级联的学生-教师训练过程如何影响模型在弱标签数据集中的标签噪声鲁棒性?
  • RQ3从多代教师模型中进行知识蒸馏,在多大程度上能提升时间定位的准确性?
  • RQ4该方法在像 Audioset 这类大规模弱标签数据集中的多样化声音类别上是否具有良好的泛化能力?
  • RQ5序列化优化过程是否能超越使用相同弱监督信号的单阶段训练?

主要发现

  • SeCoST 在 Audioset 数据集上实现了 0.383 的平均平均精度(mAP),创下弱监督音频事件检测的新 SOTA 性能。
  • 该方法显著优于先前的 SOTA 方法,证明了序列协同监督在处理弱监督任务中的有效性。
  • 级联的学生-教师训练过程提升了模型对标签噪声的鲁棒性,尤其在模糊或重叠音频事件的情况下表现更优。
  • 跨多代模型的知识蒸馏相比单阶段训练,带来了更好的泛化能力和更高的定位准确性。
  • 所提出的框架有效利用了弱标签数据,无需强标签,实现了对数百种类别的可扩展音频事件检测。
  • 序列化优化机制实现了渐进式的性能提升,每一阶段的学生模型在 mAP 和定位一致性方面均优于前序模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。