[论文解读] Proposal-based Few-shot Sound Event Detection for Speech and Environmental Sounds with Perceivers
该论文提出了一种基于提议的少样本声音事件检测框架,采用Perceiver架构以提升长音频记录中罕见或未见声音事件的定位与分类性能。在5-shot 5-way任务下,该方法在新型ESC-CASE和Vox-CASE数据集上分别取得了0.483和0.418的SOTA F1分数,相较于基线方法分别相对提升了72.5%和11.2%。
Many applications involve detecting and localizing specific sound events within long, untrimmed documents, including keyword spotting, medical observation, and bioacoustic monitoring for conservation. Deep learning techniques often set the state-of-the-art for these tasks. However, for some types of events, there is insufficient labeled data to train such models. In this paper, we propose a region proposal-based approach to few-shot sound event detection utilizing the Perceiver architecture. Motivated by a lack of suitable benchmark datasets, we generate two new few-shot sound event localization datasets: "Vox-CASE," using clips of celebrity speech as the sound event, and "ESC-CASE," using environmental sound events. Our highest performing proposed few-shot approaches achieve 0.483 and 0.418 F1-score, respectively, with 5-shot 5-way tasks on these two datasets. These represent relative improvements of 72.5% and 11.2% over strong proposal-free few-shot sound event detection baselines.
研究动机与目标
- 为解决新声音类别标注数据稀缺的少样本声音事件检测挑战。
- 通过使用区域提议而非固定窗口预测,提升长音频中未修剪音频的定位精度。
- 评估Perceiver架构在少样本音频表征学习中用于声音事件检测的有效性。
- 创建并发布两个新的基准数据集——ESC-CASE和Vox-CASE——用于少样本情景下的声音事件定位评估。
- 在少样本设置下,特别是低数据条件下,比较基于提议与窗口级方法的性能差异。
提出的方法
- 提出两阶段框架:首先使用区域提议网络(RPN)生成候选时间提议,随后利用基于Perceiver的分类器对提议进行细化与分类。
- 采用Perceiver架构对长程音频表征进行注意力计算,替代传统RoI池化操作,以提升特征聚合效果。
- 采用原型网络进行少样本分类,通过支持集计算类别的类内原型作为类嵌入。
- 通过将具有相同预测类别的连续帧分组,并对置信度分数取平均,将窗口级预测映射为类似提议的区域。
- 采用基于episode的训练与推理方式,通过N-way K-shot任务模拟少样本场景。
- 构建两个新的基准数据集:ESC-CASE(环境声音)和Vox-CASE(名人语音)用于少样本评估。
实验结果
研究问题
- RQ1在少样本声音事件检测中,基于提议的方法是否能优于窗口级模型?
- RQ2与标准特征提取方法相比,集成Perceiver架构是否能提升少样本声音事件检测性能?
- RQ3当事件与背景噪声之间声学相似性变化时,性能如何变化?
- RQ4在少样本设置下,样本数量(如5-shot与10-shot)对检测性能有何影响?
- RQ5不同模型组件(尤其是精炼头与Perceiver)对定位精度的贡献如何?
主要发现
- 所提出的基于Perceiver的提议模型在ESC-CASE数据集上的F1分数相较窗口级基线模型相对提升了72.5%(F1为0.483)。
- 在Vox-CASE数据集上,该模型相较基线模型相对提升了11.2%的F1分数,5-shot 5-way任务下达到0.418的F1。
- RPN之后的精炼层显著提升了AP,表明精炼过程对精确定位至关重要。
- 随着事件与背景能量比(EBR)的提高,性能也随之提升;且Perceiver在ESC-CASE上的增益大于Vox-CASE,可能是因为ESC-CASE中事件与背景声学相似性更高。
- 窗口级基线模型在Vox-CASE上表现强劲,表明对于声学差异明显的事件,窗口级方法可能已足够。
- 当事件与背景区分困难时,Perceiver模块对性能的提升最为显著,表明其在复杂声学环境中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。