Skip to main content
QUICK REVIEW

[论文解读] Chunked Autoregressive GAN for Conditional Waveform Synthesis

Max Morrison, Rithesh Kumar|arXiv (Cornell University)|Oct 19, 2021
Music and Audio Processing参考文献 44被引用 6
一句话总结

该论文提出了一种分块自回归生成对抗网络(CARGAN),一种条件波形合成模型,通过自回归方式生成大段音频,结合了自回归建模的高保真度与生成对抗网络(GAN)的快速推理优势。与最先进GAN相比,CARGAN将音高误差降低了40–60%,训练时间减少了58%,同时保持了实时生成速度,并通过自回归归纳偏置更好地建模音高和基频特性,从而提升了感知质量。

ABSTRACT

Conditional waveform synthesis models learn a distribution of audio waveforms given conditioning such as text, mel-spectrograms, or MIDI. These systems employ deep generative models that model the waveform via either sequential (autoregressive) or parallel (non-autoregressive) sampling. Generative adversarial networks (GANs) have become a common choice for non-autoregressive waveform synthesis. However, state-of-the-art GAN-based models produce artifacts when performing mel-spectrogram inversion. In this paper, we demonstrate that these artifacts correspond with an inability for the generator to learn accurate pitch and periodicity. We show that simple pitch and periodicity conditioning is insufficient for reducing this error relative to using autoregression. We discuss the inductive bias that autoregression provides for learning the relationship between instantaneous frequency and phase, and show that this inductive bias holds even when autoregressively sampling large chunks of the waveform during each forward pass. Relative to prior state-of-the-art GAN-based models, our proposed model, Chunked Autoregressive GAN (CARGAN) reduces pitch error by 40-60%, reduces training time by 58%, maintains a fast generation speed suitable for real-time or interactive applications, and maintains or improves subjective quality.

研究动机与目标

  • 为解决基于GAN的波形合成中长期存在的音高和基频周期性伪影问题,尤其是在梅尔频谱图反演过程中。
  • 探究自回归归纳偏置是否能在不牺牲生成速度的前提下,提升非自回归GAN中波形建模的性能。
  • 在保持或提升主观音频质量的同时,减少条件波形合成中的训练时间和内存消耗。
  • 通过在大段音频上使用因果自回归条件建模,实现实时、流式音频生成。
  • 证明音高和基频周期性准确性是波形合成中关键的感知因素,其影响超过一般频谱保真度的影响。

提出的方法

  • CARGAN的生成器在单次前向传播中自回归地生成大段音频(例如2048个样本),每一段都基于先前生成的片段和完整的条件信号(如梅尔频谱图)进行条件化。
  • 模型采用具有大感受野的因果卷积架构,以在每一段内建立长距离自回归依赖关系,从而保持相位和频率的一致性。
  • 判别器被训练以区分真实音频与生成音频,重点检测与音高和周期性错误相关的伪影。
  • 训练目标结合了对抗损失、感知损失以及音高/周期性正则化损失,以提升预测基频与真实基频之间、波形周期性之间的对齐程度。
  • 模型采用分块自回归因子化:p(x|c) = ∏_{i} p(x_{chunk_i} | x_{<i}, c),其中各段按顺序生成,但以大块形式处理,以降低计算开销。
  • 通过缩短序列长度(2048 vs. HiFi-GAN的8192),优化了训练过程,实现了更快的收敛速度和更低的内存占用。

实验结果

研究问题

  • RQ1即使在分块、非顺序生成的方案中,自回归归纳偏置是否仍能提升基于GAN的波形合成中音高和周期性的准确性?
  • RQ2音高和周期性误差在多大程度上与基于GAN模型的主观音频质量相关?
  • RQ3结合自回归建模与GAN训练的混合方法,是否能在保持快速推理速度的同时,减少训练时间和内存使用?
  • RQ4自回归生成中的分块大小如何影响训练速度、推理速度与音频质量之间的权衡?
  • RQ5在大段音频上使用自回归条件建模,是否比标准的非自回归GAN更好地保持相位和频率关系?

主要发现

  • 与最先进基于GAN的模型相比,CARGAN将音高误差降低了40–60%,显著提升了音准准确性。
  • 由于序列长度缩短(2048 vs. 8192样本),CARGAN的训练时间减少了58%,内存使用量降低了69%。
  • CARGAN在GPU上保持了10.7 RTF的实时生成速度,在CPU上为0.45 RTF,支持在交互式或流媒体应用中的实际部署。
  • 主观评估显示,CARGAN的感知质量优于以往基于GAN的模型,且周期性RMSE与听者偏好之间存在强相关性。
  • 该模型表明,即使在大段音频生成中,自回归归纳偏置也能更好地建模瞬时频率与相位之间的累积关系。
  • 在分块边界处仍存在伪影,表明未来工作需关注跨分块边界更平滑的自回归条件建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。