Skip to main content
QUICK REVIEW

[论文解读] A Comparison of Five Multiple Instance Learning Pooling Functions for Sound Event Detection with Weak Labeling

Yun Wang, Juncheng Li|arXiv (Cornell University)|Oct 22, 2018
Music and Audio Processing被引用 10
一句话总结

该论文比较了五种多实例学习(MIL)池化函数在弱监督音素事件检测(SED)中的表现,发现线性软最大池化在定位精度方面优于最大池化、平均池化、指数软最大池化和注意力池化。基于该函数,作者提出了TALNet,这是首个在不进行微调的情况下,于AudioSet上实现最先进音素标记性能,并在DCASE 2017上取得优异定位结果的模型。

ABSTRACT

Sound event detection (SED) entails two subtasks: recognizing what types of sound events are present in an audio stream (audio tagging), and pinpointing their onset and offset times (localization). In the popular multiple instance learning (MIL) framework for SED with weak labeling, an important component is the pooling function. This paper compares five types of pooling functions both theoretically and experimentally, with special focus on their performance of localization. Although the attention pooling function is currently receiving the most attention, we find the linear softmax pooling function to perform the best among the five. Using this pooling function, we build a neural network called TALNet. It is the first system to reach state-of-the-art audio tagging performance on Audio Set, while exhibiting strong localization performance on the DCASE 2017 challenge at the same time.

研究动机与目标

  • 评估并比较在仅提供片段级标签的弱监督音素事件检测场景下,五种MIL池化函数的性能。
  • 识别出在定位精度与帧级预测一致性之间实现最佳平衡的池化函数。
  • 开发一种统一的深度学习模型,使其在音素标记与音素事件定位任务中均表现优异。
  • 证明线性软最大池化相比基于注意力的方法,可实现更优的梯度流动与更低的误报率。

提出的方法

  • 作者实现了五种池化函数:最大池化、平均池化、线性软最大池化、指数软最大池化和注意力池化,每种函数均将帧级预测结果转换为录音级概率。
  • 将每种池化函数集成至基于CRNN的神经网络架构中,对弱标签音频数据进行端到端训练。
  • 线性软最大池化函数通过使用线性缩放的logits计算帧概率的加权平均,确保梯度流动平滑。
  • 模型使用交叉熵损失函数,将预测的录音级概率与AudioSet和DCASE 2017中的弱标签进行对比进行训练。
  • 通过验证集对超参数和类别特定阈值进行调优,并应用数据平衡技术以缓解类别不平衡问题。
  • 最终模型TALNet采用线性软最大池化函数,并在AudioSet(用于标记)和DCASE 2017(用于定位)上进行评估。

实验结果

研究问题

  • RQ1在弱监督音素事件检测中,哪种MIL池化函数能实现最佳定位性能?
  • RQ2不同池化函数如何影响帧级预测与录音级预测之间的一致性?
  • RQ3能否通过单一模型在音素标记与定位任务中均实现最先进性能?
  • RQ4尽管注意力池化函数广受欢迎,为何其在定位任务中导致更高的误报率?
  • RQ5线性软最大池化函数是否相比其他池化函数具有更优的梯度流动与训练稳定性?

主要发现

  • 线性软最大池化函数在DCASE 2017挑战赛中实现了45.4的最高定位F1分数,优于最大池化(42.2)和注意力池化(45.5)的F1分数,同时错误率更低(78.9 vs 注意力池化的92.0)。
  • TALNet在AudioSet上实现了0.359的平均精度均值(MAP),与Yu等人[23]的最先进结果0.360非常接近,并优于比较中的所有其他系统。
  • 尽管注意力池化函数广受欢迎,但其错误率高达92.0,且误报过多,表明其在帧级定位性能上表现较差。
  • 线性软最大池化函数在梯度流动方面表现更优,并在误报与漏报之间实现了更佳平衡。
  • TALNet是目前已知首个在不进行微调的情况下,同时在音素标记(AudioSet)与定位(DCASE 2017)任务中均取得优异性能的模型。
  • 理论分析证实,线性软最大池化允许无阻碍的梯度流动,而最大池化仅通过最高激活值反向传播梯度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。