Skip to main content
QUICK REVIEW

[论文解读] Conditional WaveGAN

Chae Young Lee, Anoop Toffy|arXiv (Cornell University)|Sep 27, 2018
Music and Audio Processing参考文献 6被引用 3
一句话总结

本文提出条件WaveGAN(cWaveGAN),一种生成对抗网络,通过基于拼接的条件控制和条件缩放方法,生成以类别标签为条件的真实原始音频波形。该模型在无条件WaveGAN的基础上实现了更高保真度的音频生成,尽管训练不稳定性和噪声问题仍是挑战。

ABSTRACT

Generative models are successfully used for image synthesis in the recent years. But when it comes to other modalities like audio, text etc little progress has been made. Recent works focus on generating audio from a generative model in an unsupervised setting. We explore the possibility of using generative models conditioned on class labels. Concatenation based conditioning and conditional scaling were explored in this work with various hyper-parameter tuning methods. In this paper we introduce Conditional WaveGANs (cWaveGAN). Find our implementation at https://github.com/acheketa/cwavegan

研究动机与目标

  • 将WaveGAN扩展为基于类别标签的原始音频合成条件生成框架。
  • 探究基于拼接和条件缩放的条件控制方法在控制音频生成方面的有效性。
  • 评估不同条件控制策略下生成音频样本的质量与一致性。
  • 通过超参数调优和损失函数优化,解决生成音频中的训练不稳定性和噪声问题。
  • 探索将合成音频用作下游判别模型训练数据的可行性。

提出的方法

  • 通过基于拼接的条件控制,将类别标签作为输入同时输入生成器和判别器,以适应WaveGAN架构。
  • 通过使用标签嵌入调制生成器的特征图,实现条件缩放。
  • 采用带有梯度惩罚的WGAN-GP损失进行训练,以提升训练稳定性。
  • 在生成器和判别器网络中均使用批量归一化以及ReLU/LeakyReLU激活函数。
  • 在生成器中使用转置1D卷积,将潜在向量上采样为完整长度的音频波形。
  • 在四块NVIDIA Tesla V100 GPU和一块TPUv2上进行训练,分别使用64和1024的批量大小。

实验结果

研究问题

  • RQ1当以类别标签为条件时,条件WaveGAN能否生成高保真度、可被人耳识别的音频波形?
  • RQ2不同的条件控制机制(基于拼接与条件缩放)如何影响音频质量和训练稳定性?
  • RQ3哪些超参数配置(学习率、批量大小、优化器)能实现最稳定的训练和最佳的样本质量?
  • RQ4cWaveGAN生成的音频在多大程度上可作为判别模型的训练数据使用?
  • RQ5在训练用于原始音频生成的条件GAN时,主要挑战是什么,如何加以缓解?

主要发现

  • 条件WaveGAN成功生成了以类别标签为条件的、可被人耳识别的原始音频波形,证明了可控音频合成的可行性。
  • 与无条件WaveGAN相比,该模型在样本质量上有所提升,生成的语音和乐器声音具有可感知的可懂性。
  • 训练不稳定性和噪声输出频繁出现,尤其是在训练初期阶段。
  • 采用带有梯度惩罚的WGAN-GP相比标准GAN目标,显著提升了训练稳定性。
  • 超参数调优,尤其是学习率的调整,在减少判别器损失尖峰和提升生成器性能方面至关重要。
  • 条件缩放和基于拼接的条件控制均产生了合理的结果,但不同实验中的条件一致性存在差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。