Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Drum Transcription in Polyphonic Music

Yu Wang, Justin Salamon|arXiv (Cornell University)|Aug 6, 2020
Music and Audio Processing参考文献 29被引用 9
一句话总结

本文提出了一种用于多声部音乐中开放词汇自动爵士鼓记谱的 few-shot 学习方法,采用在合成数据集上训练的原型网络,在推理时仅需少量标注样本即可识别新的鼓声。该方法在固定词汇量设置下性能与或优于最先进监督模型,并能有效泛化到训练时未见的、更细粒度的乐器类别。

ABSTRACT

Data-driven approaches to automatic drum transcription (ADT) are often limited to a predefined, small vocabulary of percussion instrument classes. Such models cannot recognize out-of-vocabulary classes nor are they able to adapt to finer-grained vocabularies. In this work, we address open vocabulary ADT by introducing few-shot learning to the task. We train a Prototypical Network on a synthetic dataset and evaluate the model on multiple real-world ADT datasets with polyphonic accompaniment. We show that, given just a handful of selected examples at inference time, we can match and in some cases outperform a state-of-the-art supervised ADT approach under a fixed vocabulary setting. At the same time, we show that our model can successfully generalize to finer-grained or extended vocabularies unseen during training, a scenario where supervised approaches cannot operate at all. We provide a detailed analysis of our experimental results, including a breakdown of performance by sound class and by polyphony.

研究动机与目标

  • 解决监督式 ADT 模型受限于固定且较小的鼓声词汇表的局限性。
  • 实现对训练时未见或更细粒度的打击乐器类别(如非词汇内乐器)的自动鼓声记谱。
  • 通过在推理时仅需每目标乐器少量示例,最大限度减少人工标注工作量。
  • 开发一种 few-shot 学习框架,可泛化至包含多个同时发生的鼓击的多声部音乐。
  • 研究支持集示例中的多声部性对模型性能的影响,并为有效示例选择提供指导。

提出的方法

  • 在大规模合成鼓声数据集(Slakh2100)上训练原型网络,学习鼓声的判别性嵌入。
  • 使用元训练(episodic training)模拟 few-shot 分类任务,每个任务中每类包含少量支持样本。
  • 在推理时,通过对其少量标注样本的嵌入取平均,将每个目标鼓声表示为原型。
  • 通过计算音频帧到各原型的距离进行分类,选择距离最近的类别作为预测结果。
  • 将每个乐器单独记谱作为二分类问题处理,以应对多声部性,避免多标签复杂性。
  • 应用后处理步骤以优化击打起始时间,并从置信度分数生成符号化鼓谱。

实验结果

研究问题

  • RQ1few-shot 学习模型是否能在每种乐器仅使用少量标注样本的情况下,在标准 ADT 基准上取得具有竞争力的性能?
  • RQ2当记谱目标为训练数据中未出现的乐器类别时(即开放词汇泛化),模型表现如何?
  • RQ3支持集示例中的多声部性(即目标示例的多声部性)如何影响模型正确记谱鼓事件的能力?
  • RQ4在固定词汇量设置下,该模型是否优于或匹配最先进监督式 ADT 系统?
  • RQ5在多声部性和乐器内容方面,选择支持示例的最优策略是什么,以最大化记谱准确率?

主要发现

  • few-shot 模型在标准基准上达到或优于最先进监督式 ADT 系统的性能,在固定词汇量设置下,Slakh2100 和 FMA 数据集的 F-measure 分别达到 0.66 和 0.62。
  • 模型能有效泛化到未见过的、更细粒度的乐器类别:当使用 10 个类别训练并在 3 个保留类别上测试时,F-measure 达到 0.83。
  • 当支持集的多声部性与查询音频匹配时性能最高,随着多声部性增加,F-measure 提升,因为乐器组合更一致。
  • 当多声部性不匹配时,若支持集的多声部性低于查询音频,模型表现更好,表明高多声部性支持示例会使模型混淆。
  • 即使在记谱原始训练词汇表之外的乐器时,模型仍保持强劲性能,证明了成功的开放词汇泛化能力。
  • 结果表明,支持集组成(尤其是多声部性和乐器内容)显著影响性能,凸显了推理时进行有意识示例选择的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。