Skip to main content
QUICK REVIEW

[论文解读] Conditioning Deep Generative Raw Audio Models for Structured Automatic Music

Rachel Manzelli, Vijay Thakkar|arXiv (Cornell University)|Jun 26, 2018
Music and Audio Processing参考文献 7被引用 8
一句话总结

该论文提出了一种混合音乐生成模型,通过双向LSTM生成的符号化旋律来条件化基于WaveNet的原始音频生成器,从而实现结构化、逼真音色的音乐合成。通过利用LSTM的长程旋律结构作为局部条件信号,该模型无需中间的符号到音频转换步骤,即可生成富有表现力且连贯的音频,实现了MIDI输入与生成音频输出之间的高度相关性。

ABSTRACT

Existing automatic music generation approaches that feature deep learning can be broadly classified into two types: raw audio models and symbolic models. Symbolic models, which train and generate at the note level, are currently the more prevalent approach; these models can capture long-range dependencies of melodic structure, but fail to grasp the nuances and richness of raw audio generations. Raw audio models, such as DeepMind's WaveNet, train directly on sampled audio waveforms, allowing them to produce realistic-sounding, albeit unstructured music. In this paper, we propose an automatic music generation methodology combining both of these approaches to create structured, realistic-sounding compositions. We consider a Long Short Term Memory network to learn the melodic structure of different styles of music, and then use the unique symbolic generations from this model as a conditioning input to a WaveNet-based raw audio generator, creating a model for automatic, novel music. We then evaluate this approach by showcasing results of this work.

研究动机与目标

  • 为解决WaveNet等原始音频生成模型缺乏长程音乐结构的问题,这些模型虽然能生成逼真但无结构的音频。
  • 克服符号化模型的局限性,这些模型虽能生成结构化音乐,但需要后期处理转换为音频,且缺乏音色丰富性。
  • 开发一个统一框架,结合原始音频模型的表现力与真实感和符号化模型的结构连贯性。
  • 实现从符号化旋律条件输入到结构化、高保真音频的直接、端到端生成,消除中间合成步骤。

提出的方法

  • 训练一个双向长短期记忆网络(LSTM),从音乐数据中生成符号化旋律,以捕捉长程旋律依赖关系。
  • 将生成的符号化序列(类似MIDI的时间序列)用作基于WaveNet的原始音频生成器的局部条件信号。
  • 在MusicNet数据集上对WaveNet模型进行微调,以在不同乐器和流派中生成逼真音频。
  • 通过交叉注意力或拼接机制实现条件化,使符号化旋律在每个时间步与音频生成过程对齐。
  • 采用MIDI和频谱峰值的频域表示,以实现条件输入与输出之间的互相关分析。
  • 该方法支持通过修改符号化输入并重新生成对应音频来编辑现有音频,同时保持音频保真度。

实验结果

研究问题

  • RQ1基于WaveNet的原始音频生成器能否有效通过符号化旋律序列进行条件化,以生成结构化、逼真音色的音乐?
  • RQ2该条件化模型在生成音频中多大程度上保留了输入符号化序列的旋律结构?
  • RQ3该模型在仅修改符号化条件输入的情况下,能在多大程度上用于编辑现有音频?
  • RQ4符号化输入与生成音频之间的互相关性是否表现出有意义的、非随机的对齐?
  • RQ5通过在不同符号化旋律上进行条件化,该模型能否生成特定流派或乐器的音乐?

主要发现

  • 条件化后的WaveNet模型成功利用LSTM建模长程旋律依赖的能力,生成了逼真且结构化的音乐。
  • 互相关分析显示,在延迟0处,符号化条件与生成音频之间存在显著峰值,相关系数为0.3,且该相关性在随机MIDI序列下仍具有统计稳健性。
  • 该模型支持富有表现力的音频编辑:对符号化旋律的微小改动会在生成的音频波形中产生相应且可感知的有意义变化。
  • 该方法可通过在不同训练模型上进行条件化,实现同一旋律在不同流派或乐器中的并行生成,从而无需模型耦合即可实现类似合奏的效果。
  • 通过众包方式(如Amazon Mechanical Turk)进行的人工评估证实,与无条件WaveNet生成相比,该模型在感知质量与结构连贯性方面均有提升。
  • 模块化架构支持可扩展的多领域音乐生成,例如通过在对齐的符号化输入上进行条件化,实现语音与音乐的融合,用于歌词演唱的生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。