Skip to main content
QUICK REVIEW

[论文解读] Large-Scale MIDI-based Composer Classification

Qiuqiang Kong, Keunwoo Choi|arXiv (Cornell University)|Oct 28, 2020
Music and Audio Processing参考文献 26被引用 6
一句话总结

本文提出了一种基于GiantMIDI-Piano数据集的大型MIDI作曲家分类系统,利用帧、起音和力度滚筒(rolls)作为输入,通过卷积循环神经网络(CRNNs)实现最先进性能。结果表明,在10位作曲家分类任务中,MIDI表示法优于基于音频的对数梅尔倒谱图(accuracy: 0.739),而在100位作曲家任务中,由于音色泛化能力更强,音频特征表现更优。

ABSTRACT

Music classification is a task to classify a music piece into labels such as genres or composers. We propose large-scale MIDI based composer classification systems using GiantMIDI-Piano, a transcription-based dataset. We propose to use piano rolls, onset rolls, and velocity rolls as input representations and use deep neural networks as classifiers. To our knowledge, we are the first to investigate the composer classification problem with up to 100 composers. By using convolutional recurrent neural networks as models, our MIDI based composer classification system achieves a 10-composer and a 100-composer classification accuracies of 0.648 and 0.385 (evaluated on 30-second clips) and 0.739 and 0.489 (evaluated on music pieces), respectively. Our MIDI based composer system outperforms several audio-based baseline classification systems, indicating the effectiveness of using compact MIDI representations for composer classification.

研究动机与目标

  • 为解决古典钢琴音乐作曲家分类任务中缺乏大规模符号音乐数据集的问题。
  • 探究MIDI表示法是否能在作曲家分类任务中超越基于音频的特征。
  • 评估帧、起音和力度滚筒作为深度学习模型输入表示的有效性。
  • 比较在MIDI和音频特征下,10位与100位作曲家分类任务中的性能表现。
  • 分析模型混淆模式,并识别影响分类的作曲家特定特征重要性。

提出的方法

  • 本研究使用从转录MIDI文件中提取的帧滚筒、起音滚筒和力度滚筒作为输入表示,每种表示均为T×K张量格式,其中T为时间帧数,K=88为钢琴键数量。
  • 模型采用卷积神经网络(CNNs)和卷积循环神经网络(CRNNs)实现,后者结合CNN进行局部特征提取,LSTM进行时序建模。
  • 基于音频的基线模型使用对数幅度梅尔倒谱图(X_mel)作为输入,通过标准预处理从音频片段中计算得出。
  • 系统在30秒片段和完整乐曲上进行训练与评估,通过平均片段级预测结果获得乐曲级预测。
  • 在100位作曲家分类任务中,采用所有作曲家的宏平均准确率,以确保在类别不平衡数据集下的公平性。
  • 训练与评估均在GiantMIDI-Piano数据集上进行,该数据集包含来自2,786位作曲家的10,854个MIDI文件,30秒片段和完整乐曲均用于评估。

实验结果

研究问题

  • RQ1在大规模作曲家分类任务中,MIDI表示法是否能超越基于音频的表示法?
  • RQ2帧、起音和力度滚筒在单独使用及组合使用时,如何影响不同作曲家集合的分类准确率?
  • RQ3随着作曲家数量的增加(10 vs. 100),MIDI模型的性能是下降还是提升?
  • RQ4哪些作曲家最容易或最难被分类,哪些特征对识别其作品贡献最大?
  • RQ5模型架构(CNN与CRNN)如何影响MIDI和音频输入下的性能表现?

主要发现

  • 使用帧+起音+力度滚筒的CRNN模型在完整乐曲上预测时,10位作曲家分类任务的准确率达到最高,为0.739。
  • 在30秒片段上,基于MIDI的CRNN系统在10位作曲家分类任务中达到0.648的准确率,优于基于音频的CRNN(0.620)及其他所有MIDI配置。
  • 在100位作曲家分类任务中,基于音频的对数梅尔倒谱图优于所有MIDI表示,CRNN模型达到0.385的准确率,而最佳MIDI系统仅达到0.342。
  • 引入力度滚筒对部分作曲家(如李斯特)的分类有提升作用,但对其他作曲家(如巴赫、肖邦)则导致性能下降,表明特征相关性具有作曲家特异性。
  • 通过平均片段级输出结果获得的乐曲级预测优于片段级预测,最佳系统在10位作曲家任务中达到0.739的准确率,在100位作曲家任务中达到0.489。
  • 贝多芬常与舒伯特和莫扎特混淆,而亨德尔与J.S.巴赫因共享巴洛克时期的风格特征,也表现出较高混淆度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。