Skip to main content
QUICK REVIEW

[论文解读] Segment-level Metric Learning for Few-shot Bioacoustic Event Detection

Haohe Liu, Xubo Liu|arXiv (Cornell University)|Jul 15, 2022
Animal Vocal Communication and Behavior被引用 5
一句话总结

该论文提出了一种用于少样本生物声学事件检测的片段级度量学习框架,通过在训练过程中联合优化正样本和负样本音频片段,提升了模型的泛化能力。通过引入归纳推理并利用占训练数据91.3%的负样本事件,该方法在DCASE2022-T5验证集上实现了62.73的F1值,比基线原型网络高出28.71分,位列挑战赛第二名。

ABSTRACT

Few-shot bioacoustic event detection is a task that detects the occurrence time of a novel sound given a few examples. Previous methods employ metric learning to build a latent space with the labeled part of different sound classes, also known as positive events. In this study, we propose a segment-level few-shot learning framework that utilizes both the positive and negative events during model optimization. Training with negative events, which are larger in volume than positive events, can increase the generalization ability of the model. In addition, we use transductive inference on the validation set during training for better adaptation to novel classes. We conduct ablation studies on our proposed method with different setups on input features, training data, and hyper-parameters. Our final system achieves an F-measure of 62.73 on the DCASE 2022 challenge task 5 (DCASE2022-T5) validation set, outperforming the performance of the baseline prototypical network 34.02 by a large margin. Using the proposed method, our submitted system ranks 2nd in DCASE2022-T5. The code of this paper is fully open-sourced at https://github.com/haoheliu/DCASE_2022_Task_5.

研究动机与目标

  • 通过在模型训练过程中利用以往被低估的负样本音频片段,提升少样本生物声学事件检测性能。
  • 通过使用未标记验证数据的归纳推理方案,增强模型泛化能力。
  • 研究输入特征、嵌入维度和数据增强对少样本SED性能的影响。
  • 评估PSDS是否作为少样本音频检测的更稳健指标,相较于F1值,因其考虑了多种阈值和后处理设置。
  • 开发一个完全开源的系统,在DCASE2022-T5基准上实现最先进性能。

提出的方法

  • 该方法采用原型网络架构,并在N-way-M-shot设置下进行元训练,其中每类M个片段用作支持集和查询集。
  • 使用可学习的特征提取器将音频片段嵌入潜在空间,通过同类别嵌入的平均值形成原型。
  • 对比损失不仅应用于同类别正样本之间,也应用于正样本与负样本之间,以增强决策边界的鲁棒性。
  • 在训练过程中应用归纳推理,利用未标记的验证数据迭代优化预测结果并更新模型参数。
  • 系统采用PCEN与Δ-MFCC作为输入特征,通过自适应平均池化控制嵌入维度,并通过后处理优化检测输出。
  • 对负样本使用、归纳推理、后处理以及数据组合(DCASE2022-T5 + AudioSet-SL)进行了消融研究。

实验结果

研究问题

  • RQ1在度量学习中引入以往被低估的负样本音频片段,能否显著提升少样本生物声学事件检测性能?
  • RQ2使用未标记验证数据的归纳推理是否能显著增强少样本SED中的模型泛化能力?
  • RQ3哪种输入特征组合(如PCEN + Δ-MFCC)在DCASE2022-T5基准上表现最佳?
  • RQ4结合领域不匹配的数据(如DCASE2022-T5与AudioSet-SL)如何影响模型的鲁棒性与整体性能?
  • RQ5由于PSDS考虑了多种阈值和后处理设置,它是否比F1值更适合用作少样本音频检测的评估指标?

主要发现

  • 所提方法在DCASE2022-T5验证集上实现62.73的F1值,显著优于基线原型网络(34.02)。
  • 该系统在DCASE2022-T5挑战赛中位列第二,表明其在新型生物声学类别上具备出色的泛化能力与鲁棒性。
  • 若移除负样本对比损失,F1值下降至55.25,表明负样本事件对性能至关重要。
  • 引入归纳推理使F1值从56.37提升至62.73,表明其在适应新类别方面具有显著价值。
  • 采用PCEN与Δ-MFCC作为输入特征组合时性能最佳,在消融实验中优于其他组合。
  • 结合DCASE2022-T5与AudioSet-SL数据可达到最高PSDS(58.77),表明尽管F1值有所下降,但其在多种阈值下的泛化能力得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。