Skip to main content
QUICK REVIEW

[论文解读] Modelling Symbolic Music: Beyond the Piano Roll

Christian Walder|arXiv (Cornell University)|Jun 4, 2016
Music and Audio Processing参考文献 3被引用 8
一句话总结

本文提出了一种新颖的符号音乐生成方法,通过将多音音乐转换为单变量分类序列,使自然语言处理中的最先进LSTM语言模型得以应用。通过在所有音乐调性上进行移调的数据增强,并支持任意节奏结构,该模型在基准数据集上实现了最先进性能,并生成了比以往基于RNN的模型更具音乐复杂性的作品。

ABSTRACT

In this paper, we consider the problem of probabilistically modelling symbolic music data. We introduce a representation which reduces polyphonic music to a univariate categorical sequence. In this way, we are able to apply state of the art natural language processing techniques, namely the long short-term memory sequence model. The representation we employ permits arbitrary rhythmic structure, which we assume to be given. We show that our model is effective on four out of four piano roll based benchmark datasets. We further improve our model by augmenting our training data set with transpositions of the original pieces through all musical keys, thereby convincingly advancing the state of the art on these benchmark problems. We also fit models to music which is unconstrained in its rhythmic structure, discuss the properties of this model, and provide musical samples which are more sophisticated than previously possible with this class of recurrent neural network sequence models. We also provide our newly preprocessed data set of non piano-roll music data.

研究动机与目标

  • 解决将多音音乐建模为具有复杂同时音符组合的序列数据问题的挑战。
  • 通过在音乐建模中支持任意节奏结构,克服固定时间钢琴卷帘表示的局限性。
  • 通过在所有音乐调性上进行移调的数据增强,提升符号音乐生成基准测试的性能。
  • 证明使用LSTM的单变量序列建模能够生成超越以往基于RNN方法的音乐连贯且复杂的乐曲。
  • 发布一个全新的、预处理过的非钢琴卷帘符号音乐数据集,以支持未来研究。

提出的方法

  • 该模型将多音音乐简化为单变量的音符事件序列,其中每个时间步代表一个单一的分类音符或和弦事件。
  • 采用多层长短期记忆(LSTM)网络来建模单变量音符序列中的序列依赖关系。
  • 输入表示将每个音符编码为88个MIDI音符词汇表中的离散标记,支持使用交叉熵损失进行端到端训练。
  • 通过将每首原始作品移调至全部12个音乐调性,实施数据增强,显著扩展了训练分布并提升了泛化能力。
  • 该模型以作为输入的固定节奏结构进行条件控制,使其能够生成具有复杂非均匀音符时值的音乐。
  • 一个学习得到的嵌入层将原始音符索引映射到密集语义空间,揭示了八度等价等结构模式。

实验结果

研究问题

  • RQ1使用LSTM的单变量序列建模方法是否能有效捕捉具有同时音符事件的多音音乐的复杂性?
  • RQ2在所有音乐调性上通过移调进行数据增强对符号音乐生成基准测试性能有何影响?
  • RQ3当以任意节奏结构作为条件时,基于RNN的模型在生成音乐连贯且节奏复杂的音乐方面能达到何种程度?
  • RQ4学习得到的嵌入空间是否能捕捉到八度等价或和弦功能等有意义的音乐关系?
  • RQ5该模型是否能超越钢琴卷帘格式数据的限制,并生成优于以往序列模型的高质量输出?

主要发现

  • 该模型在四个基于钢琴卷帘的基准数据集上实现了最先进性能,显著受益于基于移调的数据增强。
  • 该模型能够生成具有复杂非均匀节奏结构的音乐,而传统钢琴卷帘模型由于分辨率限制无法实现此类结构。
  • 学习得到的嵌入层揭示了与八度等价相对应的清晰结构模式,尽管原始输入是正交且无结构的。
  • 该模型在多种音乐来源上表现稳健,且合并多个来源的数据可进一步提升结果。
  • 作者发布了全新的非钢琴卷帘符号音乐预处理数据集,支持未来在算法作曲领域的研究。
  • 该模型生成的音乐样本展现出比以往基于RNN的模型更高的复杂度和音乐连贯性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。