Skip to main content
QUICK REVIEW

[论文解读] Multi-instrument Music Synthesis with Spectrogram Diffusion

Curtis Hawthorne, Ian Simon|arXiv (Cornell University)|Jun 11, 2022
Music and Audio Processing被引用 15
一句话总结

本文提出了一种基于频谱图扩散模型的实时、多乐器音乐合成系统,可将MIDI序列转换为高保真音频,并实现完整的音符级控制。通过结合基于Transformer的MIDI到频谱图解码器(使用去噪扩散概率模型,DDPM进行训练)与基于GAN的频谱图反演器,该方法在段落边界处实现了优于自回归基线的音频质量和时间一致性。

ABSTRACT

An ideal music synthesizer should be both interactive and expressive, generating high-fidelity audio in realtime for arbitrary combinations of instruments and notes. Recent neural synthesizers have exhibited a tradeoff between domain-specific models that offer detailed control of only specific instruments, or raw waveform models that can train on any music but with minimal control and slow generation. In this work, we focus on a middle ground of neural synthesizers that can generate audio from MIDI sequences with arbitrary combinations of instruments in realtime. This enables training on a wide range of transcription datasets with a single model, which in turn offers note-level control of composition and instrumentation across a wide range of instruments. We use a simple two-stage process: MIDI to spectrograms with an encoder-decoder Transformer, then spectrograms to audio with a generative adversarial network (GAN) spectrogram inverter. We compare training the decoder as an autoregressive model and as a Denoising Diffusion Probabilistic Model (DDPM) and find that the DDPM approach is superior both qualitatively and as measured by audio reconstruction and Fréchet distance metrics. Given the interactivity and generality of this approach, we find this to be a promising first step towards interactive and expressive neural synthesis for arbitrary combinations of instruments and notes.

研究动机与目标

  • 开发一种实时、交互式的神经合成器,能够为任意乐器组合和音符组合生成高保真音频。
  • 通过使用通用且数据高效的架构,克服现有神经合成器在控制力与泛化能力之间的权衡。
  • 通过用扩散建模替代自回归解码,提升基于频谱图的合成在音频质量和时间连贯性方面的表现。
  • 通过在先前生成的频谱图上进行上下文感知条件控制,实现在段落边界处一致的音频生成。
  • 证明在包含真实录音和合成数据的多样化配对音频/MIDI数据集上进行单一模型训练的可行性。

提出的方法

  • 该模型采用两阶段流程:首先,基于Transformer的编码器-解码器将MIDI音符事件转换为频谱图,其中解码器以去噪扩散概率模型(DDPM)进行训练。
  • DDPM解码器通过迭代去噪高斯噪声生成高保真频谱图,其性能优于逐帧的自回归解码。
  • 为确保5秒音频段之间的时序连续性,第二组编码器将先前生成段的频谱图作为条件输入解码器。
  • 推理阶段,使用类似于MelGAN的基于GAN的声码器将生成的频谱图反演为波形。
  • 该模型在广泛的配对音频/MIDI数据集上进行训练,包括真实录音(如Guitarset、URMP)和合成数据,从而实现对不同乐器和声学环境的泛化能力。
  • 模型容量扩展至“基础”架构,以处理额外的上下文输入,减少边界伪影并提升音频质量。

实验结果

研究问题

  • RQ1单一通用的基于Transformer的模型能否有效从MIDI输入合成任意乐器组合的高保真音频?
  • RQ2与自回归解码相比,使用DDPM训练频谱图解码器是否在音频质量与感知一致性方面表现更优?
  • RQ3对先前频谱图段的上下文条件控制能否有效消除连续音频生成中段落边界处的可听伪影?
  • RQ4在多样化数据集上进行统一训练的模型,在泛化至真实录音(包括拨弦噪声、 vibrato 等细微演奏特征)方面能达到何种程度?
  • RQ5在标准指标(如Fréchet Audio Distance和Transcription F1)下,该模型的性能与自回归基线相比如何量化评估?

主要发现

  • DDPM解码器在定性和定量评估中均优于自回归基线,取得了最高的Fréchet Audio Distance(FAD)和Transcription F1得分。
  • 在先前频谱图段上添加上下文条件控制,成功消除了段落边界伪影,显著提升了长音频生成的时间连贯性。
  • 该模型在验证集上的Transcription F1得分接近1.0,表明对目标频谱图实现了近乎完美的重建,尽管音频保真度仍低于原始波形质量。
  • 即使未显式输入力度或演奏特征条件,该模型仍能合成自然的演奏细节,如吉他录音中的拨弦噪声和管弦乐乐器中的 vibrato。
  • 尽管经过频谱图反演步骤,该模型仍略快于实时推理,支持交互式应用。
  • 在验证集上未观察到过拟合现象,表明进一步扩大模型规模有望进一步提升音频保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。