Skip to main content
QUICK REVIEW

[论文解读] Encoding Musical Style with Transformer Autoencoders

Kristy Choi, Curtis Hawthorne|arXiv (Cornell University)|Dec 10, 2019
Music and Audio Processing参考文献 35被引用 9
一句话总结

本文提出了一种Transformer自编码器,这是一种序列自编码模型,通过聚合来自Transformer编码器的时间编码,学习音乐演奏风格的全局无监督表征。通过将此全局风格代码与旋律嵌入相结合,该模型实现了对音乐的可控生成,使其匹配单个输入演奏的风格,在MAESTRO和大规模YouTube钢琴数据集上,相比基线模型,其对数似然得分和听众偏好得分均有所提升。

ABSTRACT

We consider the problem of learning high-level controls over the global structure of generated sequences, particularly in the context of symbolic music generation with complex language models. In this work, we present the Transformer autoencoder, which aggregates encodings of the input data across time to obtain a global representation of style from a given performance. We show it is possible to combine this global representation with other temporally distributed embeddings, enabling improved control over the separate aspects of performance style and melody. Empirically, we demonstrate the effectiveness of our method on various music generation tasks on the MAESTRO dataset and a YouTube dataset with 10,000+ hours of piano performances, where we achieve improvements in terms of log-likelihood and mean listening scores as compared to baselines.

研究动机与目标

  • 为解决在符号音乐生成中学习高层级、全局控制的挑战。
  • 实现在无需显式标注或标签的情况下,生成与给定演奏风格一致的可控音乐。
  • 开发一种将全局风格表征与细粒度旋律条件相结合的方法,以提升生成控制能力。
  • 通过大规模钢琴演奏数据集上的定量指标和定性听觉研究,验证该方法的有效性。

提出的方法

  • 该模型使用Transformer编码器处理输入的MIDI序列,从演奏中的每个标记中提取时间嵌入。
  • 通过可学习的全局池化机制,将这些时间嵌入在整个序列上聚合,形成紧凑的全局风格表征。
  • 该全局风格代码随后与一个独立的旋律嵌入结合,该旋律嵌入基于新的旋律输入进行条件化。
  • 将组合后的表征输入到Transformer解码器中,以生成既匹配风格又匹配新旋律的新音乐。
  • 该模型通过在符号音乐序列上使用自回归语言建模范式进行端到端训练。
  • 该方法在编码器和解码器中均利用相对位置注意力机制,以保持长期音乐结构和周期性。

实验结果

研究问题

  • RQ1神经自编码器能否在无监督方式下学习到有意义的、音乐演奏风格的全局表征?
  • RQ2该学习到的全局风格表征能否与新旋律有效结合,以生成连贯且风格一致的音乐?
  • RQ3将全局风格与局部旋律条件结合是否能提升生成质量,相比基线模型?
  • RQ4该模型能否泛化到未见过的演奏,并仅使用单个输入样本就适应新风格?

主要发现

  • 在MAESTRO和YouTube钢琴演奏数据集上,Transformer自编码器的对数似然得分均高于基线模型。
  • 在用户听觉研究中,该模型生成的样本在与输入风格的感知相似度上显著优于基线模型。
  • 该模型成功地将新旋律以给定演奏的风格进行和声处理,证明了风格与旋律控制的有效分离。
  • 插值实验表明,不同演奏风格之间的过渡平滑且具有感知意义,验证了解耦表征的有效性。
  • 即使仅基于单个输入演奏进行条件化,该方法仍优于基线模型,证明了其强大的 few-shot 适应能力。
  • 通过基于音符的特征分析和定性评估,验证了该模型能够生成与输入演奏具有高度感知相似性的音乐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。