Skip to main content
QUICK REVIEW

[论文解读] Symbolic Music Generation with Diffusion Models

Gautam Mittal, Jesse Engel|arXiv (Cornell University)|Mar 30, 2021
Music and Audio Processing参考文献 48被引用 9
一句话总结

本文提出一种基于预训练变分自编码器(VAE)连续潜在表示的扩散模型,用于符号音乐生成,实现长旋律序列的非自回归、并行生成。该方法在无条件与条件补全任务上均达到最先进性能,优于自回归基线模型如TransformerMDN,在生成质量与结构一致性方面表现更优。

ABSTRACT

Score-based generative models and diffusion probabilistic models have been successful at generating high-quality samples in a variety of continuous domains. However, due to their Langevin-inspired sampling mechanisms, their application to discrete symbolic music data has been limited. In this work, we present a technique for training diffusion models on symbolic music data by parameterizing the discrete domain in the continuous latent space of a pre-trained variational autoencoder. Our method is non-autoregressive and learns to generate sequences of latent embeddings through the reverse process and offers parallel generation with a constant number of iterative refinement steps. We show strong unconditional generation and post-hoc conditional infilling results compared to autoregressive language models operating over the same continuous embeddings.

研究动机与目标

  • 使扩散模型能够生成高质量符号音乐,而符号音乐本质上是离散的,因此与标准连续域扩散采样不兼容。
  • 通过预训练VAE将符号音乐映射到连续潜在空间,以克服基于Langevin的采样在离散空间中的局限性。
  • 证明在VAE潜在表示上训练的扩散模型能够生成长时序、结构一致的音乐序列。
  • 通过在潜在空间中对部分序列进行条件控制,实现后处理条件生成(如补全)。
  • 将扩散模型在潜在表示上的性能与强大的自回归基线(如TransformerMDN)进行比较。

提出的方法

  • 该方法使用预训练的2小节旋律MusicVAE将离散MIDI序列嵌入到连续潜在码中,将离散音乐转化为连续潜在空间。
  • 在这些连续潜在表示上训练去噪扩散概率模型(DDPM),学习逆转一个逐步向潜在表示添加噪声的前向扩散过程。
  • 采样过程从随机高斯噪声开始,通过反向扩散过程逐步优化,生成可解码为MIDI的潜在序列。
  • 模型采用时间依赖的噪声调度,并基于在每一步扩散过程中预测添加的噪声,最小化预测噪声与真实噪声之间的L2损失。
  • 对于条件补全任务,通过在反向采样过程中固定首尾部分序列的潜在表示,实现对缺失段落的连贯补全。
  • 该框架支持非自回归生成,固定数量的优化步骤,实现并行采样,推理速度优于自回归模型。

实验结果

研究问题

  • RQ1扩散模型能否有效应用于传统上与连续扩散采样不兼容的离散符号音乐数据?
  • RQ2在VAE学习的连续潜在表示上训练扩散模型,是否能生成比自回归模型更高质量、更具结构一致性的音乐?
  • RQ3所提出的方法能否支持后处理条件生成(如补全),即基于上下文完成缺失的音乐段落?
  • RQ4潜在空间中的迭代优化过程如何随时间影响样本质量与结构一致性?
  • RQ5扩散模型在连续潜在表示的分层建模方面是否优于自回归基线(如TransformerMDN),特别是在减少暴露偏差方面?

主要发现

  • 扩散模型能够生成1024个标记(64小节)的高质量无条件旋律序列,具有强结构一致性和音乐流畅性。
  • 在一致性和方差相似性度量上,该模型优于自回归基线TransformerMDN,表明其在潜在表示的分层建模方面表现更优。
  • 对32小节缺失段落的后处理条件补全任务中,生成结果在一致性和方差相似性上均达到高水平,优于潜在插值与独立先验采样方法。
  • 潜在表示度量在优化过程中稳步提升,而帧级自相似性度量在早期即表现出稳定性,方差相似性仅在后期步骤中显现,表明质量逐步提升。
  • 该方法支持固定步数的并行生成,推理速度优于自回归模型,且不损失样本质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。