Skip to main content
QUICK REVIEW

[论文解读] Learning to match transient sound events using attentional similarity for few-shot sound recognition

Szu-Yu Chou, Kai-Hsiang Cheng|arXiv (Cornell University)|Dec 4, 2018
Music and Audio Processing参考文献 22被引用 3
一句话总结

本文提出了一种注意力相似性模块,通过可学习的注意力机制聚焦于瞬态音频事件,从而增强少样本声音识别性能。该模块集成于基于度量的学习的框架中,提升了对短时、显著声音的匹配准确率,在五种基线方法下,ESC-50数据集上相对提升4.1%至7.7%,在噪声ESC-50数据集上相对提升2.1%至6.5%。

ABSTRACT

In this paper, we introduce a novel attentional similarity module for the problem of few-shot sound recognition. Given a few examples of an unseen sound event, a classifier must be quickly adapted to recognize the new sound event without much fine-tuning. The proposed attentional similarity module can be plugged into any metric-based learning method for few-shot learning, allowing the resulting model to especially match related short sound events. Extensive experiments on two datasets shows that the proposed module consistently improves the performance of five different metric-based learning methods for few-shot sound recognition. The relative improvement ranges from +4.1% to +7.7% for 5-shot 5-way accuracy for the ESC-50 dataset, and from +2.1% to +6.5% for noiseESC-50. Qualitative results demonstrate that our method contributes in particular to the recognition of transient sound events.

研究动机与目标

  • 为解决仅用少量训练样本识别罕见或瞬态声音事件的挑战。
  • 通过增强基于度量学习框架中的相似性匹配,提升少样本声音识别性能。
  • 开发一种即插即用的模块,引导模型关注相关音频片段,而无需实例级标注。
  • 在干净和噪声音频基准上评估该方法,以评估其在真实环境条件下的鲁棒性。

提出的方法

  • 注意力相似性模块用可学习的注意力机制替代标准相似性函数,突出音频片段中的相关时间片段。
  • 它在支持样本和查询样本的特征图上计算注意力权重,强调短时瞬态事件而非背景噪声。
  • 该模块具有可微性,可集成到任意基于度量的少样本学习模型中,如原型网络(Prototypical Networks)或匹配网络(Matching Networks)。
  • 注意力机制仅使用片段级标签进行训练,避免了弱监督实例级标注的需求。
  • 主干网络采用简单的CNN架构,包含3×3卷积、批归一化、ReLU激活函数,以及在对数梅尔倒谱图上应用的4×4最大池化层。
  • 训练采用交叉熵损失,结合随机梯度下降(SGD)、权重衰减和学习率衰减策略,输入特征为16 kHz音频的z分数归一化梅尔倒谱图。

实验结果

研究问题

  • RQ1注意力相似性模块是否能提升少样本声音识别性能,特别是在瞬态声音事件方面?
  • RQ2与基于度量学习中的标准相似性函数相比,注意力相似性模块如何提升匹配准确率?
  • RQ3该模块是否能在不同基于度量的学习框架和数据集(包括噪声音频)上实现泛化?
  • RQ4在少样本分类过程中,该模块在多大程度上减少了背景噪声的干扰?
  • RQ5该模块是否能仅使用片段级标注有效训练,而无需实例级标签?

主要发现

  • 在五种基于度量的学习方法上,注意力相似性模块将5-way 5-shot准确率在干净ESC-50数据集上提升了4.1%至7.7%。
  • 在噪声ESC-50数据集上,该模块在5-way 5-shot学习中实现了2.1%至6.5%的相对增益,表明其对环境噪声具有鲁棒性。
  • 结合注意力相似性模块的原型网络在5-way 5-shot ESC-50上达到最高准确率74.2%,在噪声ESC-50上达到65.7%。
  • 定性分析表明,带注意力的模型能正确匹配瞬态事件,而基线模型常选择具有相似静音时长的片段。
  • 注意力图显示,该模块能有效抑制背景噪声并增强对短时事件的关注,突出显示相关音频片段。
  • 该方法具有普适性,在多种基于度量的模型中均一致提升性能,表明其具备强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。