[论文解读] Towards multi-instrument drum transcription
本文提出一个大规模合成数据集,并训练卷积神经网络与卷积循环神经网络(CRNNs),以实现对标准三只鼓(军鼓、低音鼓、踩镲)以外的多乐器鼓音符转录,从而提升模型在真实世界数据上的泛化能力。主要贡献在于公开提供一个平衡的合成数据集及训练好的模型,支持8种和18种鼓乐器类别,尤其在军鼓和吊镲等代表性不足的乐器上性能显著提升。
Automatic drum transcription, a subtask of the more general automatic music transcription, deals with extracting drum instrument note onsets from an audio source. Recently, progress in transcription performance has been made using non-negative matrix factorization as well as deep learning methods. However, these works primarily focus on transcribing three drum instruments only: snare drum, bass drum, and hi-hat. Yet, for many applications, the ability to transcribe more drum instruments which make up standard drum kits used in western popular music would be desirable. In this work, convolutional and convolutional recurrent neural networks are trained to transcribe a wider range of drum instruments. First, the shortcomings of publicly available datasets in this context are discussed. To overcome these limitations, a larger synthetic dataset is introduced. Then, methods to train models using the new dataset focusing on generalization to real world data are investigated. Finally, the trained models are evaluated on publicly available datasets and results are discussed. The contributions of this work comprise: (i.) a large-scale synthetic dataset for drum transcription, (ii.) first steps towards an automatic drum transcription system that supports a larger range of instruments by evaluating and discussing training setups and the impact of datasets in this context, and (iii.) a publicly available set of trained models for drum transcription. Additional materials are available at http://ifs.tuwien.ac.at/~vogl/dafx2018
研究动机与目标
- 解决现有自动鼓音符转录系统仅能转录三种主要鼓乐器(军鼓、低音鼓、踩镲)的局限性。
- 通过在大规模、平衡的合成数据集(4197首曲目,约259小时)上训练模型,提升模型在真实世界音频上的泛化能力。
- 评估数据集构成、类别平衡与训练策略对多种乐器类别转录性能的影响。
- 为未来多乐器鼓音符转录研究提供公开可获取的训练模型与数据集。
提出的方法
- 端到端训练卷积神经网络与卷积循环神经网络(CRNNs),同时预测多个鼓乐器的击打激活。
- 构建一个包含4197首曲目的合成数据集,约259小时音频,使用通用MIDI映射覆盖8种与18种鼓乐器类别。
- 应用数据平衡技术以减少类别不平衡,提升对军鼓与吊镲等代表性不足乐器的性能。
- 采用多任务训练设置,使用单一模型转录所有目标乐器,提升参数效率与泛化能力。
- 在公开数据集(如ENST、MAESTRO)上评估模型,以衡量跨数据集泛化能力与鲁棒性。
- 通过伪混淆矩阵分析错误模式,识别常见误判,例如音色相近乐器之间的混淆(如BD/LT、CHH/PHH)。
实验结果
研究问题
- RQ1单一深度学习模型能否有效转录超出标准三类(军鼓、低音鼓、踩镲)的更广泛鼓乐器类别(最多18类)?
- RQ2与仅使用真实世界数据相比,基于大规模、合成且平衡的数据集训练是否能显著提升模型在真实世界音频上的泛化能力?
- RQ3数据平衡与混合训练策略(如先在合成数据上预训练,再在真实数据上微调)对代表性不足鼓乐器类别的性能有何影响?
- RQ4不同乐器类别在转录中的错误模式有何差异?这些模式揭示了哪些关于乐器听觉相似性与标注模糊性的见解?
主要发现
- 在合成数据集上训练的模型在真实世界数据上泛化良好,在ENST与MAESTRO等公开基准上表现强劲,即使未经过真实数据的微调。
- 在合成数据集上训练后,代表性不足类别(如LT、MT、RD、CRC、CHC)的性能得到提升,表明其在数据增强方面的有效性。
- 对合成数据集进行平衡处理虽提升了代表性不足类别的训练性能,但并未一致改善跨数据集泛化能力,提示数据分布设计中存在权衡。
- 伪混淆矩阵显示,音色相近的乐器(如踩镲变体、军鼓、吊镲)常被混淆,表明鼓声音色分类存在固有的听觉模糊性。
- 先在合成MIDI数据集上预训练,再在真实世界数据集组合上微调,可获得在所有类别上表现优异的模型,尤其提升了稀有乐器的检测能力。
- 本系统证明了大规模多乐器鼓音符转录的可行性,公开提供的模型与数据集为可复现研究与未来开发提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。