Skip to main content
QUICK REVIEW

[论文解读] Music theme recognition using CNN and self-attention

Manoj Sukhavasi, Sainath Adapa|arXiv (Cornell University)|Nov 16, 2019
Music and Audio Processing参考文献 17被引用 14
一句话总结

本文提出了一种结合 MobileNetV2 与自注意力机制的混合深度学习模型,用于音乐主题与情绪识别。通过利用梅尔频谱图特征和数据增强技术,该模型在 MediaEval 2019 PR-AUC-macro 排行榜中取得第4名,显著优于基线 VGG-ish 模型,证明了自注意力机制在捕捉音乐音频中长期时序依赖关系方面的有效性。

ABSTRACT

We present an efficient architecture to detect mood/themes in music tracks on autotagging-moodtheme subset of the MTG-Jamendo dataset. Our approach consists of two blocks, a CNN block based on MobileNetV2 architecture and a self-attention block from Transformer architecture to capture long term temporal characteristics. We show that our proposed model produces a significant improvement over the baseline model. Our model (team name: AMLAG) achieves 4th place on PR-AUC-macro Leaderboard in MediaEval 2019: Emotion and Theme Recognition in Music Using Jamendo.

研究动机与目标

  • 通过深度学习改进音乐标签自动识别,用于情绪与主题识别。
  • 解决在可变长度音乐片段中捕捉长期时序依赖关系的挑战。
  • 提升在 MTG-Jamendo 数据集的 autotagging-moodtheme 子集上的性能。
  • 评估将 MobileNetV2 与自注意力机制结合在音频分类任务中的有效性。
  • 在 MediaEval 2019 音乐情绪与主题识别任务中实现最先进水平的结果。

提出的方法

  • 模型使用预计算的梅尔频谱图作为输入,通过随机裁剪、缩放、SpecAugment 和 Mixup 进行归一化与数据增强。
  • 通过两层卷积层将单通道梅尔频谱图转换为三通道张量,对 MobileNetV2 主干网络进行适配以处理单通道输入。
  • 引入受 Transformer 架构启发的自注意力模块,通过多头注意力与位置编码捕捉长程时序依赖关系。
  • 将输入划分为 16 个时间步长为 256 的段,每段先经 MobileNetV2 处理,再输入至自注意力模块。
  • 采用两个预测头:一个来自仅 MobileNetV2,另一个来自 MobileNetV2 与自注意力结合的模型,训练过程中使用联合损失函数。
  • 训练采用每类独立的早停策略与学习率衰减策略;在 60 个周期后,将优化器从 Adam 切换至带 Nesterov 动量的 SGD,以提升泛化能力。

实验结果

研究问题

  • RQ1轻量级 CNN 架构如 MobileNetV2 是否能有效从梅尔频谱图中提取用于音乐标签识别的判别性特征?
  • RQ2集成自注意力机制是否能提升对音乐音频中长期时序模式的建模能力?
  • RQ3MobileNetV2 与自注意力机制的结合在多标签音乐情绪与主题分类任务中,相较于基线模型表现如何?
  • RQ4SpecAugment 与 Mixup 等数据增强技术在该音频标签任务中在多大程度上提升了泛化能力?
  • RQ5为何某些类别在联合训练下未能提升性能?是否存在特定类别的训练策略可缓解此问题?

主要发现

  • 所提出的 MobileNetV2 与自注意力结合的模型在 MediaEval 2019 PR-AUC-macro 排行榜中取得第4名,得分为 0.125896。
  • 模型的 ROC-AUC-macro 提升至 0.752886,显著优于基线 VGG-ish 模型(0.725821)。
  • F-score-macro 提升至 0.182957,优于基线模型(0.165694)与仅使用 MobileNetV2 的模型(0.151891)。
  • 模型的召回率-macro 达到 0.39164,表明在所有类别中对正样本标签的检测能力优于基线模型。
  • 采用类别特定的早停策略改善了单个标签的收敛性,但整体上联合训练仍更有效。
  • 自注意力与 MobileNetV2 的结合性能优于单独使用 MobileNetV2 或其他架构(如 ResNeXt 和基于 OpenL3 的模型)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。