[论文解读] Improving Perceptual Quality of Drum Transcription with the Expanded Groove MIDI Dataset
本文介绍了扩展的鼓 MIDI 数据集(E-GMD),这是一个包含 444 小时人类演奏的鼓音符转录数据集,附带力度标注,并利用该数据集训练了一个能够预测时间与力度的模型,以提升鼓音符转录的感知音质。尽管分类指标相似,但听音测试显示,具备力度感知的生成显著提升了音质感知,表明标准指标无法充分反映下游感知性能。
We introduce the Expanded Groove MIDI dataset (E-GMD), an automatic drum transcription (ADT) dataset that contains 444 hours of audio from 43 drum kits, making it an order of magnitude larger than similar datasets, and the first with human-performed velocity annotations. We use E-GMD to optimize classifiers for use in downstream generation by predicting expressive dynamics (velocity) and show with listening tests that they produce outputs with improved perceptual quality, despite similar results on classification metrics. Via the listening tests, we argue that standard classifier metrics, such as accuracy and F-measure score, are insufficient proxies of performance in downstream tasks because they do not fully align with the perceptual quality of generated outputs.
研究动机与目标
- 为解决缺乏大规模、人类演奏的带力度标注的鼓数据集的问题,此类数据集限制了富有表现力的鼓音符转录。
- 探究在预测击打时间之外,是否预测力度能够提升重合成鼓音频的感知质量。
- 挑战标准分类指标(如 F1 分数)作为下游音频生成任务中感知性能充分代理的假设。
- 开发并评估一个在 E-GMD 上训练的深度学习模型,该模型联合预测时间、鼓类型和力度,以提升音频真实感。
- 证明听音测试在评估转录系统中的价值,尤其是在分类器指标无法预测感知质量时。
提出的方法
- 引入了扩展的鼓 MIDI 数据集(E-GMD),包含来自 43 套真实鼓组的 444 小时音频,每处击打均有手工标注的时间与力度。
- 训练了一个深度学习模型(OaF-Drums),配备独立的力度预测头,以同时预测击打时间、力度和鼓类型。
- 应用了一种新颖的随机混音(Shuffled mixup)数据增强策略,以正则化模型并减少在大规模 E-GMD 数据集上的过拟合。
- 使用 FluidSynth 和通用 MIDI 声音库(SoundFont)对模型输出进行重合成,将预测的击打和力度映射到标准鼓样本,以实现一致的音频渲染。
- 开展了大规模听音测试,共 496 个音频片段,通过成对偏好判断比较了具备与不具备力度预测的模型的重合成输出。
- 使用统计检验(Kruskal-Wallis H 检验与 Wilcoxon 符号秩检验)并结合 Bonferroni 校正,验证了听音测试结果中感知差异的显著性。
实验结果
研究问题
- RQ1即使分类指标保持相似,是否在预测击打时间的基础上增加力度预测,能够带来感知上更优的鼓音符转录输出?
- RQ2标准分类指标(如 F1 分数)在多大程度上无法作为音频生成任务中感知质量的充分代理?
- RQ3在大规模数据集中包含人工标注的力度信息,如何提升重合成鼓演奏的真实感?
- RQ4像随机混音(Shuffled mixup)这样的数据增强技术,能否有效正则化在大规模、多样化鼓数据集上训练的模型?
- RQ5包含力度预测的鼓音符转录与将力度固定为常量的转录之间,是否存在统计上显著的感知差异?
主要发现
- 在成对听音比较中,基于 E-GMD 训练的 OaF-Drums 模型获得了 919 次胜利,显著优于未使用力度预测的模型。
- 具备力度预测的模型在 2,976 次成对比较中赢下 919 次,而固定力度的模型仅赢下 456 次,表明其在感知上具有显著优势。
- Kruskal-Wallis H 检验确认了模型间存在显著差异(χ²(2) = 559.19,p < 0.001),事后检验显示所有成对差异均显著(p < 0.001/6)。
- 尽管分类指标(如 F1 分数)表现相似,但具备力度感知的模型生成的转录在感知质量上显著更优,表明标准指标与人类感知之间存在脱节。
- E-GMD 数据集包含 444 小时人类演奏的音频与力度标注,其规模比以往数据集大一个数量级,且是首个包含此类标注的数据集。
- 随机混音(Shuffled mixup)数据增强策略有效减少了过拟合,并提升了模型在大规模 E-GMD 数据集上的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。