Skip to main content
QUICK REVIEW

[论文解读] MP3net: coherent, minute-long music generation from raw audio with a simple convolutional GAN

Korneel van den Broek|arXiv (Cornell University)|Jan 12, 2021
Speech and Audio Processing参考文献 30被引用 5
一句话总结

MP3net 是一种深度卷积 GAN,通过使用 MDCT 变换的振幅表示,直接从原始音频生成高质量、连贯的、时长约一分钟的立体声音乐。通过利用心理声学掩蔽效应,并采用渐进式、上下文感知的架构,且深层网络具有完整的时序感受野,该模型实现了稳定的训练和近乎即时的推理,在单个 Cloud TPUv2 上训练 250 小时后可生成 95 秒的音频样本。

ABSTRACT

We present a deep convolutional GAN which leverages techniques from MP3/Vorbis audio compression to produce long, high-quality audio samples with long-range coherence. The model uses a Modified Discrete Cosine Transform (MDCT) data representation, which includes all phase information. Phase generation is hence integral part of the model. We leverage the auditory masking and psychoacoustic perception limit of the human ear to widen the true distribution and stabilize the training process. The model architecture is a deep 2D convolutional network, where each subsequent generator model block increases the resolution along the time axis and adds a higher octave along the frequency axis. The deeper layers are connected with all parts of the output and have the context of the full track. This enables generation of samples which exhibit long-range coherence. We use MP3net to create 95s stereo tracks with a 22kHz sample rate after training for 250h on a single Cloud TPUv2. An additional benefit of the CNN-based model architecture is that generation of new songs is almost instantaneous.

研究动机与目标

  • 从原始音频直接生成长时长、连贯的、高保真度的音乐样本,而无需依赖符号音乐或 MIDI 格式。
  • 通过利用 MP3/Vorbis 压缩中的心理声学原理,降低原始音频生成的计算需求。
  • 通过在不可听范围内注入心理声学噪声来扩大真实数据分布的支持范围,从而稳定 GAN 训练。
  • 通过采用具有全上下文感受野的深层 CNN 架构,实现在近似即时的音频生成。
  • 通过确保深层网络层能够访问完整的时序上下文,实现生成音乐的长时程连贯性。

提出的方法

  • 模型使用保留完整相位信息的改进离散余弦变换(MDCT)振幅表示,实现无需谱图反演的直接音频重建。
  • 在判别器训练期间注入不可听的心理声学噪声,以扩大真实数据分布的支持范围,提升训练稳定性。
  • 生成器架构沿时间轴逐步提高分辨率,并在频率轴上增加更高八度,深层网络接收全上下文输入。
  • 通过将更高八度的频带通过求和折叠到较低八度,实现渐进式训练的适应,从而在不造成模糊的情况下为深层网络生成降采样后的谱图。
  • 在 MDCT 振幅空间中使用逐像素特征归一化,而非批量归一化,以维持稳定性。
  • 模型采用条件 GAN 设置进行训练,其中在后期训练阶段冻结深层网络,以减少噪声并提升音频质量。

实验结果

研究问题

  • RQ1在 MDCT 振幅表示上训练的 GAN 能否从原始音频生成连贯、高质量、时长约一分钟的立体声音乐样本?
  • RQ2如何利用人类听觉的心理声学特性来稳定 GAN 训练并降低计算需求?
  • RQ3基于 CNN 的架构在深层网络中具备全上下文感受野,能在多大程度上确保生成音乐的长时程时间连贯性?
  • RQ4能否在不损失关键信号信息的前提下,将渐进式训练方法适配到基于 MDCT 的音频表示?
  • RQ5与基于谱图的方法相比,使用保留相位信息的 MDCT 表示在音频质量和训练稳定性方面有何差异?

主要发现

  • MP3net 能够以 22kHz 的采样率成功生成 95 秒的立体声音频样本,具有高感知质量与强长时程连贯性。
  • 通过注入不可听的心理声学噪声,模型实现了稳定的训练,该噪声扩大了数据分布的支持范围,有效缓解了模式崩溃问题。
  • 深层网络中全上下文感受野使模型能够从头到尾生成具有音乐结构连贯性的输出,显著增强了时间一致性。
  • 由于高效的 CNN 架构,推理过程近乎即时,适用于实时应用场景。
  • 使用保留相位信息的 MDCT 振幅表示消除了对谱图反演的需求,简化了生成流程。
  • 在单个 Cloud TPUv2 上训练 250 小时即可生成高质量样本,相比其他原始音频生成模型展现出更高的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。