Skip to main content
QUICK REVIEW

[论文解读] An Attention Mechanism for Musical Instrument Recognition

Siddharth Gururani, Mohit Sharma|arXiv (Cornell University)|Jul 9, 2019
Music and Audio Processing参考文献 39被引用 7
一句话总结

本文提出了一种用于弱标签多音音乐数据的注意力机制,基于 OpenMIC 数据集中的弱标签多音音频数据进行多标签音乐乐器识别。通过将任务建模为多实例多标签学习问题,该注意力机制通过聚焦于每种乐器的相关时间片段,提升了分类性能,特别是提高了召回率和 F1 分数,相较于基线模型,实现了更准确且可解释的预测。

ABSTRACT

While the automatic recognition of musical instruments has seen significant progress, the task is still considered hard for music featuring multiple instruments as opposed to single instrument recordings. Datasets for polyphonic instrument recognition can be categorized into roughly two categories. Some, such as MedleyDB, have strong per-frame instrument activity annotations but are usually small in size. Other, larger datasets such as OpenMIC only have weak labels, i.e., instrument presence or absence is annotated only for long snippets of a song. We explore an attention mechanism for handling weakly labeled data for multi-label instrument recognition. Attention has been found to perform well for other tasks with weakly labeled data. We compare the proposed attention model to multiple models which include a baseline binary relevance random forest, recurrent neural network, and fully connected neural networks. Our results show that incorporating attention leads to an overall improvement in classification accuracy metrics across all 20 instruments in the OpenMIC dataset. We find that attention enables models to focus on (or 'attend to') specific time segments in the audio relevant to each instrument label leading to interpretable results.

研究动机与目标

  • 解决在缺乏细粒度时间标注的弱标签多音音乐数据集上训练准确乐器识别模型的挑战。
  • 克服多标签乐器识别中的类别不平衡问题,特别是针对低频次乐器如单簧管或长笛。
  • 通过注意力机制定位每个乐器标签的相关音频片段,提升模型的可解释性。
  • 证明注意力机制聚合实例级预测的结果优于传统模型(如随机森林、全连接网络和循环神经网络)在 OpenMIC 数据集上的表现。

提出的方法

  • 将乐器识别任务建模为多实例多标签(MIML)学习问题,其中每个音频片段被视为一组短时音频实例的“袋”。
  • 应用注意力机制,根据每个时间实例对各乐器标签的相关性动态加权,实现对显著片段的选择性关注。
  • 使用前馈神经网络预测每个实例的乐器存在性,随后通过可微分的注意力层,利用学习到的注意力权重聚合预测结果。
  • 使用二元交叉熵损失函数并配合 Sigmoid 激活函数进行端到端训练,多标签输出采用 0.5 的阈值进行最终二元预测。
  • 将注意力模型(ATT)与基线模型进行比较:二元相关随机森林(RF_BR)、使用平均池化的全连接网络(FC_T)以及循环神经网络(RNN)。
  • 可视化注意力权重,以评估模型的可解释性,并验证注意力机制是否成功定位了音频片段中的相关乐器活动。

实验结果

研究问题

  • RQ1与标准深度学习和传统机器学习基线相比,注意力机制是否能提升弱标签多音音乐数据上的多标签乐器识别性能?
  • RQ2注意力机制是否有助于缓解乐器识别中的类别不平衡问题,特别是对单簧管或长笛等低频次乐器?
  • RQ3注意力机制在多大程度上能够定位音频片段中的相关时间片段,从而增强模型的可解释性?
  • RQ4与使用平均池化(FC_T)或循环结构(RNN)聚合实例级预测的模型相比,注意力机制模型在性能上表现如何?

主要发现

  • 注意力机制在 OpenMIC 数据集中所有 20 种乐器上均显著提升了召回率和 F1 分数,尤其对单簧管、长笛和风琴等类别不平衡严重的乐器受益明显。
  • 注意力模型(ATT)在几乎所有乐器上的 F1 分数均优于二元相关随机森林(RF_BR)基线,尤其在正负样本比例严重失衡的乐器上表现更优。
  • ATT 的性能优于使用平均池化的全连接网络(FC_T),表明基于注意力的聚合方式比简单的平均聚合更有效。
  • RNN 基线优于 RF_BR,表明建模实例序列中的时间相关性可提升性能,但 ATT 在整体准确率上仍超越 RNN。
  • 注意力权重的可视化结果表明,模型成功定位了音频片段中的乐器活动,例如在小提琴显著演奏时段聚焦于小提琴,以及在人声出现时聚焦于人声。
  • 该模型在保持轻量化架构的同时,在弱监督乐器识别任务上达到了最先进性能,表明其在实际音乐信息检索应用中具备可扩展性和实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。