Skip to main content
QUICK REVIEW

[论文解读] Audio Set classification with attention model: A probabilistic perspective

Qiuqiang Kong, Yong Xu|View|Nov 2, 2017
Music and Audio Processing参考文献 12被引用 8
一句话总结

本文提出了一种基于注意力机制的深度学习模型,用于在大规模 AudioSet 数据集上的音频标记任务,将注意力建模为袋内实例上的可学习概率测度。通过使用带有 softmax 激活函数的全连接神经网络进行注意力建模,该方法实现了 0.327 的 mAP,优于 Google 的基线模型(0.314)和基于 RNN 的模型(0.325),其核心思想是将袋级别分类建模为加权实例预测的期望值,其中权重为学习到的注意力分数。

ABSTRACT

This paper investigates the classification of the Audio Set dataset. Audio Set is a large scale weakly labelled dataset of sound clips. Previous work used multiple instance learning (MIL) to classify weakly labelled data. In MIL, a bag consists of several instances, and a bag is labelled positive if at least one instances in the audio clip is positive. A bag is labelled negative if all the instances in the bag are negative. We propose an attention model to tackle the MIL problem and explain this attention model from a novel probabilistic perspective. We define a probability space on each bag, where each instance in the bag has a trainable probability measure for each class. Then the classification of a bag is the expectation of the classification output of the instances in the bag with respect to the learned probability measure. Experimental results show that our proposed attention model modeled by fully connected deep neural network obtains mAP of 0.327 on Audio Set dataset, outperforming the Google's baseline of 0.314 and recurrent neural network of 0.325.

研究动机与目标

  • 解决在包含 527 个类别的大规模 AudioSet 数据集上弱监督音频标记的挑战。
  • 在现有基线模型(如 Google 的全连接 DNN 和基于 RNN 的模型)基础上进一步提升分类性能。
  • 为多实例学习(MIL)背景下注意力机制提供一种新颖的概率解释。
  • 探索不同非负激活函数(ReLU、Sigmoid、Softmax)在建模注意力权重方面的有效性。

提出的方法

  • 使用包含三个全连接层、ReLU 激活函数和 Dropout 的深度神经网络,同时建模分类器和每个实例的注意力(概率测度)。
  • 将袋中每个实例的注意力权重定义为嵌入表示的归一化、非负函数,其中 Softmax 表现最佳。
  • 将袋级别预测计算为加权实例预测的期望值,形式化表示为 E[f_k(x) | p_k(x)] = Σ p_k(x) * f_k(x),其中求和覆盖袋内所有实例。
  • 采用数据平衡策略以缓解弱标签 AudioSet 数据集中存在的类别不平衡问题。
  • 以预训练模型(在 YouTube-100M 上训练)的瓶颈特征作为输入,提取每秒 1 个的 128 维 PCA 降维特征。
  • 在全部 527 个类别上使用平均准确率(mAP)、AUC 和 d-prime 作为评估指标。

实验结果

研究问题

  • RQ1与传统池化策略相比,将注意力机制建模为可学习概率测度是否能在大规模 AudioSet 数据集上提升音频标记性能?
  • RQ2在 MIL 框架中,非负激活函数的选择(ReLU、Sigmoid、Softmax)如何影响注意力机制的性能?
  • RQ3所提出的概率注意力模型在 mAP 和 AUC 指标上是否优于 Google 基线模型和基于 RNN 的模型?
  • RQ4数据平衡策略在 AudioSet 中长尾类别分布上的泛化能力方面,其提升效果有多大?
  • RQ5注意力机制是否能有效定位相关音频事件,同时抑制背景噪声,正如其与特征选择的相似性所暗示的那样?

主要发现

  • 采用 Softmax 激活函数的所提注意力模型实现了 0.327 的 mAP,优于 Google 基线模型(0.314)和基于 RNN 的平均池化模型(0.325)。
  • 采用数据平衡策略后,mAP 从 0.275 提升至 0.296,证明其在缓解类别不平衡问题上的有效性。
  • 在非负激活函数中,Softmax 表现最佳,实现 0.327 的 mAP、0.965 的 AUC 和 2.558 的 d-prime。
  • 平均池化和最大池化性能均低于所提注意力机制,其中平均池化 mAP 为 0.296,最大池化为 0.284。
  • 注意力机制能有效学习为相关音频片段分配更高权重,从而实现更优的定位能力并增强对背景噪声的鲁棒性。
  • 将注意力解释为可学习概率测度的概率化框架,为音频标记任务中的多实例学习提供了原则性且可解释的建模范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。