Skip to main content
QUICK REVIEW

[论文解读] Symbolic Music Representations for Classification Tasks: A Systematic Evaluation

Huan Zhang, Emmanouil Karystinaios|arXiv (Cornell University)|Sep 5, 2023
Music and Audio ProcessingComputer Science被引用 3
一句话总结

该论文系统评估了使用卷积神经网络(CNN)、Transformer 和图神经网络(GNN)进行符号音乐分类时的矩阵(钢琴卷帘)、序列(标记化音乐)和图表示法。论文提出了一种新颖的表演图表示法,并发现基于图的模型在训练复杂度较低的情况下实现了具有竞争力的性能,在作曲家分类和难度分类等关键任务中优于传统方法。

ABSTRACT

Music Information Retrieval (MIR) has seen a recent surge in deep learning-based approaches, which often involve encoding symbolic music (i.e., music represented in terms of discrete note events) in an image-like or language like fashion. However, symbolic music is neither an image nor a sentence, and research in the symbolic domain lacks a comprehensive overview of the different available representations. In this paper, we investigate matrix (piano roll), sequence, and graph representations and their corresponding neural architectures, in combination with symbolic scores and performances on three piece-level classification tasks. We also introduce a novel graph representation for symbolic performances and explore the capability of graph representations in global classification tasks. Our systematic evaluation shows advantages and limitations of each input representation. Our results suggest that the graph representation, as the newest and least explored among the three approaches, exhibits promising performance, while being more light-weight in training.

研究动机与目标

  • 评估矩阵、序列和图表示法在符号音乐分类中的性能与效率。
  • 比较符号乐谱与演奏表现作为输入数据对分类任务的影响。
  • 提出一种新颖的符号演奏图表示法并评估其有效性。
  • 探究图表示法是否能在音乐分类任务中超越既有的图像类与语言类方法。

提出的方法

  • 将符号音乐表示为钢琴卷帘(矩阵)、标记化序列(序列)以及具有音乐边的结构化图(图)。
  • 在每种表示法上训练并评估卷积神经网络(CNN)、Transformer 和图神经网络(GNN)。
  • 构建一种异构图表示法,从乐谱和演奏中编码音高、时值、声部和节拍结构。
  • 通过注意力可视化比较 Transformer 学习到的注意力机制与图结构边之间的关系。
  • 应用新的数据划分方式,以减轻乐谱-演奏数据集中的专辑效应。
  • 在三个作品级任务上评估模型:作曲家分类、演奏者分类和难度评估。

实验结果

研究问题

  • RQ1在符号音乐分类任务中,矩阵、序列和图表示法在性能与训练效率方面如何比较?
  • RQ2使用乐谱与演奏作为输入数据对分类准确率有何影响?
  • RQ3为符号演奏提出的新型图表示法是否能与现有表示法达到相当的性能?
  • RQ4Transformer 中的注意力机制与图表示中的结构边之间有何关系?
  • RQ5乐谱-演奏数据集中的专辑效应在多大程度上影响模型泛化能力,以及如何缓解这一问题?

主要发现

  • 图表示法在乐谱的作曲家分类任务中达到最高准确率,使用高级特征时达到 87.3%,优于矩阵和序列方法。
  • 矩阵表示法在各类任务中表现出略高的平均性能,并对超参数变化更具鲁棒性。
  • 序列模型未因高级特征的引入而显著受益,原因在于词汇量增大和数据稀疏性加剧。
  • 增加声部边显著提升了图模型的性能,尤其在基于乐谱的分类任务中,凸显了结构建模的优势。
  • 发现 Transformer 学习到的注意力与图结构边之间存在弱正相关(皮尔逊相关系数 r = 0.212),表明部分对齐但感受野不同。
  • 较小的神经网络架构可达到与更大模型相当的性能,表明当前模型在作品级分类任务中往往存在过度参数化现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。