Skip to main content
QUICK REVIEW

[论文解读] Bioacoustic Event Detection with prototypical networks and data augmentation

Mark Anderson, Naomi Harte|arXiv (Cornell University)|Dec 16, 2021
Animal Vocal Communication and Behavior被引用 4
一句话总结

本文提出了一种基于原型网络与数据增强及PCEN归一化梅尔频谱图的少样本学习方法,用于生物声学事件检测。尽管F1值达到26.243%,但该方法将召回率提升至38.1%,而精确率表现较差,表明即使在特征工程和数据增强技术较为稳健的情况下,模型仍面临泛化挑战。

ABSTRACT

This report presents deep learning and data augmentation techniques used by a system entered into the Few-Shot Bioacoustic Event Detection for the DCASE2021 Challenge. The remit was to develop a few-shot learning system for animal (mammal and bird) vocalisations. Participants were tasked with developing a method that can extract information from five exemplar vocalisations, or shots, of mammals or birds and detect and classify sounds in field recordings. In the system described in this report, prototypical networks are used to learn a metric space, from which classification is performed by computing the distance of a query point to class prototypes, classifying based on shortest distance. We describe the architecture of this network, feature extraction methods, and data augmentation performed on the given dataset and compare our work to the challenge's baseline networks.

研究动机与目标

  • 开发一种少样本学习系统,仅使用每类五个标注样本即可检测和分类动物发声。
  • 在标注成本高、数据稀缺的低资源生物声学场景中提升模型泛化能力。
  • 评估数据增强与PCEN归一化在提升模型对未见动物发声类别的鲁棒性方面的有效性。
  • 与挑战基线进行比较,尤其关注F1值、精确率与召回率的表现。

提出的方法

  • 该系统利用原型网络学习一个度量空间,其中分类基于查询嵌入与类别原型之间的欧氏距离。
  • 音频被转换为128个频带、1024点FFT大小、256点步长的梅尔频谱图,随后通过逐通道能量归一化(PCEN)提升抗噪能力。
  • 数据增强包括时间拉伸(±5%)、时间掩码(T个连续时间步设为零)和频率掩码,通过Torchaudio实现。
  • 模型通过支持集上的交叉熵损失进行端到端训练,原型计算为支持集嵌入的均值。
  • 通过阈值化与边缘检测方法在注意力图上预测起始与结束时间,随后进行后处理以过滤短事件。
  • 后处理通过移除持续时间短于最短真实事件60%的事件,以减少误报。

实验结果

研究问题

  • RQ1原型网络能否在每类仅提供五个标注样本的情况下,有效泛化到未见的动物发声类别?
  • RQ2PCEN归一化与对数梅尔频谱图相比,在提升模型在噪声生物声学数据上的鲁棒性方面表现如何?
  • RQ3诸如时间拉伸与掩码等数据增强技术在多大程度上提升了少样本检测性能?
  • RQ4为何采用数据增强的模型在训练损失高于基线的情况下,验证性能反而更高?

主要发现

  • 表现最佳的模型在验证集上实现了26.243%的F1值,采用PCEN归一化频谱图与数据增强技术。
  • 与基线相比,召回率显著提升至38.1%,表明对真正阳性事件的检测能力增强。
  • 精确率下降至20.0%,因误报数量过多,表明学习到的嵌入空间中类别分离能力有限。
  • 采用数据增强与PCEN的模型优于对数梅尔频谱图基线(F1值为16.565%)。
  • 尽管训练损失更高,但增强模型收敛更稳定,且达到更低的最小损失值,表明优化动力学更优。
  • 后处理有效减少了误报,对真正阳性事件影响极小,证实其在优化预测结果中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。