Skip to main content
QUICK REVIEW

[论文解读] Symphony Generation with Permutation Invariant Language Model

Jiafeng Liu, Yuanliang Dong|arXiv (Cornell University)|May 10, 2022
Music and Audio Processing被引用 9
一句话总结

该论文提出SymphonyNet,一种用于符号交响乐生成的排列不变语言模型,采用新颖的多轨道多乐器可重复(MMR)表示方法,结合三维位置嵌入与音乐BPE子词分词方法。该模型利用线性Transformer解码器并联合进行乐器分类,生成连贯、复杂且和声和谐的交响乐作品,在多样性方面超越人类创作,并在新构建的大规模交响乐数据集上达到最先进性能。

ABSTRACT

In this work, we propose a permutation invariant language model, SymphonyNet, as a solution for symbolic symphony music generation. We propose a novel Multi-track Multi-instrument Repeatable (MMR) representation for symphonic music and model the music sequence using a Transformer-based auto-regressive language model with specific 3-D positional embedding. To overcome length overflow when modeling extra-long symphony tokens, we also propose a modified Byte Pair Encoding algorithm (Music BPE) for music tokens and introduce a novel linear transformer decoder architecture as a backbone. Meanwhile, we train the decoder to learn automatic orchestration as a joint task by masking instrument information from the input. We also introduce a large-scale symbolic symphony dataset for the advance of symphony generation research. Empirical results show that the proposed approach can generate coherent, novel, complex and harmonious symphony as a pioneer solution for multi-track multi-instrument symbolic music generation.

研究动机与目标

  • 为解决难以通过标准一维序列建模捕捉的半排列不变多轨道、多乐器交响乐建模挑战。
  • 通过引入音乐BPE实现音符、音程与和弦的子词级别分词,以减少序列长度并提升符号音乐生成中的语义丰富度。
  • 通过联合训练模型预测乐器,实现在无需显式输入乐器信息情况下的端到端自动配器。
  • 通过发布包含46,359首交响乐MIDI文件的高质量大规模数据集,推动交响乐生成研究的发展。
  • 开发可扩展架构,以处理超长交响乐序列,同时保持结构与和声连贯性。

提出的方法

  • 提出多轨道多乐器可重复(MMR)表示方法,将交响乐谱建模为包含轨道、时间与声部维度的三维张量,以保持半排列不变性。
  • 引入三维位置嵌入,编码跨轨道、时间与声部维度的相对位置,使模型能够理解管弦乐谱中的空间与时间关系。
  • 设计音乐BPE,一种改进的字节对编码算法,基于频率学习将音符组合为音程与和弦,将每音符的平均序列长度从2.28降至1.13个标记。
  • 采用线性Transformer解码器架构,高效处理长序列,并缓解标准自注意力机制在长交响乐序列中产生的二次方复杂度问题。
  • 通过联合任务学习进行模型训练:在训练过程中屏蔽乐器信息,以实现基于音符分布的端到端自动配器。
  • 构建了一个大规模符号交响乐数据集,包含46,359个高质量MIDI文件,涵盖多乐器与多轨道,以支持训练与评估。

实验结果

研究问题

  • RQ1排列不变的三维位置编码是否能有效建模交响乐谱的半排列不变结构?
  • RQ2通过音乐BPE实现的子词级别分词是否能提升符号音乐生成中的序列建模效率与语义丰富度?
  • RQ3对乐器预测的联合训练目标是否能使模型在无需显式乐器监督的情况下学习自动配器?
  • RQ4与人类创作相比,所提出模型生成的音乐在连贯性、多样性、和声性与结构复杂性方面达到何种程度?
  • RQ5在自定义数据集与公开数据集上,SymphonyNet与MMM和PopMAG等现有模型相比表现如何?

主要发现

  • 同时使用三维位置嵌入与音乐BPE的模型在训练与验证损失上均达到最低,表明其泛化能力与性能更优。
  • 人工评估显示,SymphonyNet生成的音乐在多样性方面超越人类创作(5分制评分中3.72 vs. 3.43),并在连贯性、和声性、结构与配器方面达到或超过人类水平。
  • 在Lakh MIDI数据集上的直接对比中,SymphonyNet在所有指标上均优于MMM:连贯性得分为3.33 vs. 3.20,多样性得分为2.89 vs. 2.71,整体偏好得分为2.87 vs. 2.71。
  • 音乐BPE将平均标记长度从2.28降至1.13,显著缓解了建模超长交响乐序列的负担。
  • 模型成功学习了自动配器,生成的乐器分配在上下文上合理且符合音乐惯例。
  • 所提出的MMR表示与三维位置嵌入使模型能够保留局部音乐结构与轨道间关系,避免了因一维展平带来的结构损伤。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。