Skip to main content
QUICK REVIEW

[论文解读] Proposal-based Few-shot Sound Event Detection for Speech and Environmental Sounds with Perceivers

Piper Wolters, Sizemore, Logan|arXiv (Cornell University)|Jul 28, 2021
Music and Audio Processing参考文献 39被引用 9
一句话总结

该论文提出了一种基于提议的少样本声音事件检测框架,采用Perceiver架构以提升长音频记录中罕见或未见声音事件的定位与分类性能。在5-shot 5-way任务下,该方法在新型ESC-CASE和Vox-CASE数据集上分别取得了0.483和0.418的SOTA F1分数,相较于基线方法分别相对提升了72.5%和11.2%。

ABSTRACT

Many applications involve detecting and localizing specific sound events within long, untrimmed documents, including keyword spotting, medical observation, and bioacoustic monitoring for conservation. Deep learning techniques often set the state-of-the-art for these tasks. However, for some types of events, there is insufficient labeled data to train such models. In this paper, we propose a region proposal-based approach to few-shot sound event detection utilizing the Perceiver architecture. Motivated by a lack of suitable benchmark datasets, we generate two new few-shot sound event localization datasets: "Vox-CASE," using clips of celebrity speech as the sound event, and "ESC-CASE," using environmental sound events. Our highest performing proposed few-shot approaches achieve 0.483 and 0.418 F1-score, respectively, with 5-shot 5-way tasks on these two datasets. These represent relative improvements of 72.5% and 11.2% over strong proposal-free few-shot sound event detection baselines.

研究动机与目标

  • 为解决新声音类别标注数据稀缺的少样本声音事件检测挑战。
  • 通过使用区域提议而非固定窗口预测,提升长音频中未修剪音频的定位精度。
  • 评估Perceiver架构在少样本音频表征学习中用于声音事件检测的有效性。
  • 创建并发布两个新的基准数据集——ESC-CASE和Vox-CASE——用于少样本情景下的声音事件定位评估。
  • 在少样本设置下,特别是低数据条件下,比较基于提议与窗口级方法的性能差异。

提出的方法

  • 提出两阶段框架:首先使用区域提议网络(RPN)生成候选时间提议,随后利用基于Perceiver的分类器对提议进行细化与分类。
  • 采用Perceiver架构对长程音频表征进行注意力计算,替代传统RoI池化操作,以提升特征聚合效果。
  • 采用原型网络进行少样本分类,通过支持集计算类别的类内原型作为类嵌入。
  • 通过将具有相同预测类别的连续帧分组,并对置信度分数取平均,将窗口级预测映射为类似提议的区域。
  • 采用基于episode的训练与推理方式,通过N-way K-shot任务模拟少样本场景。
  • 构建两个新的基准数据集:ESC-CASE(环境声音)和Vox-CASE(名人语音)用于少样本评估。

实验结果

研究问题

  • RQ1在少样本声音事件检测中,基于提议的方法是否能优于窗口级模型?
  • RQ2与标准特征提取方法相比,集成Perceiver架构是否能提升少样本声音事件检测性能?
  • RQ3当事件与背景噪声之间声学相似性变化时,性能如何变化?
  • RQ4在少样本设置下,样本数量(如5-shot与10-shot)对检测性能有何影响?
  • RQ5不同模型组件(尤其是精炼头与Perceiver)对定位精度的贡献如何?

主要发现

  • 所提出的基于Perceiver的提议模型在ESC-CASE数据集上的F1分数相较窗口级基线模型相对提升了72.5%(F1为0.483)。
  • 在Vox-CASE数据集上,该模型相较基线模型相对提升了11.2%的F1分数,5-shot 5-way任务下达到0.418的F1。
  • RPN之后的精炼层显著提升了AP,表明精炼过程对精确定位至关重要。
  • 随着事件与背景能量比(EBR)的提高,性能也随之提升;且Perceiver在ESC-CASE上的增益大于Vox-CASE,可能是因为ESC-CASE中事件与背景声学相似性更高。
  • 窗口级基线模型在Vox-CASE上表现强劲,表明对于声学差异明显的事件,窗口级方法可能已足够。
  • 当事件与背景区分困难时,Perceiver模块对性能的提升最为显著,表明其在复杂声学环境中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。