[论文解读] Data Augmentation for Instrument Classification Robust to Audio Effects
本文评估了在电子音乐制作中常见的音频效果下,将最先进的深度学习模型应用于乐器分类任务时的鲁棒性。结果表明,通过使用如重度失真和合唱等效果进行数据增强,可在未经处理的数据上提升分类准确率,但该模型对混响和饱和等效果仍表现出高度敏感性,表明需要采用更丰富的数据增强策略以提升鲁棒性。
Reusing recorded sounds (sampling) is a key component in Electronic Music Production (EMP), which has been present since its early days and is at the core of genres like hip-hop or jungle. Commercial and non-commercial services allow users to obtain collections of sounds (sample packs) to reuse in their compositions. Automatic classification of one-shot instrumental sounds allows automatically categorising the sounds contained in these collections, allowing easier navigation and better characterisation. Automatic instrument classification has mostly targeted the classification of unprocessed isolated instrumental sounds or detecting predominant instruments in mixed music tracks. For this classification to be useful in audio databases for EMP, it has to be robust to the audio effects applied to unprocessed sounds. In this paper we evaluate how a state of the art model trained with a large dataset of one-shot instrumental sounds performs when classifying instruments processed with audio effects. In order to evaluate the robustness of the model, we use data augmentation with audio effects and evaluate how each effect influences the classification accuracy.
研究动机与目标
- 评估最先进的乐器分类模型在应用到经常见音频效果处理的一次性乐器音符时的鲁棒性。
- 研究使用音频效果进行数据增强是否能提升模型在未经处理和已处理音频上的泛化能力与分类准确率。
- 识别哪些音频效果对分类性能造成最严重的影响,以及哪些增强方式能带来最大收益。
- 探讨当前模型在应对音频效果引入的音色变化时泛化能力的局限性。
提出的方法
- 本研究使用NSynth数据集,该数据集是包含多样化音色与音高的单次乐器音符的大规模数据集。
- 采用在对数梅尔频谱图上训练的卷积神经网络(CNN)模型作为基线最先进的乐器分类器。
- 通过使用不同参数设置应用8种常见音频效果(如重度失真、混响、合唱、镶边、回声、饱和、移调和合唱)对训练集进行增强。
- 在每个增强后的训练集上微调模型,并在未经处理和经效果处理的测试集上进行评估。
- 通过分类准确率衡量性能,比较在不同效果类型下,使用与不使用增强训练的模型表现。
- 分析在不同效果实现方式下,训练集与测试集之间性能差异,以评估模型的泛化能力。
实验结果
研究问题
- RQ1当将最先进的乐器分类器应用于经常见音频效果处理的一次性乐器音符时,其分类准确率如何下降?
- RQ2哪些音频效果显著降低分类准确率,哪些效果影响较小甚至带来正面影响?
- RQ3使用音频效果进行数据增强是否能提升模型在未经处理测试数据上的准确率?
- RQ4在训练数据中包含增强数据的情况下,模型在分类未在训练中见过的音频效果时是否表现出更强的鲁棒性?
主要发现
- 基线模型在未经处理的测试数据上达到73.78%的准确率,当使用重度失真增强训练后,准确率提升至74.73%。
- 在所有增强方式中,合唱(0.6436准确率)和重度失真(在增强测试集上为0.3518)带来的提升最大,表明基于效果的数据增强具有一定益处。
- 在经处理的测试集上,分类准确率显著下降,其中混响(-59.6%)、饱和(-28.3%)和回声(-29.8%)的下降最为严重,与未经处理的基线相比。
- 模型对镶边和移调表现出相对更高的鲁棒性,当应用这些效果时,测试集准确率下降低于4%。
- 使用增强数据进行训练可提升对应效果(如重度失真)上的性能,但对其他效果的泛化能力较弱,表明迁移能力有限。
- 本研究发现,训练集与测试集之间音频效果实现方式的差异可能阻碍模型泛化,强调了需要采用更丰富的数据增强策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。