[论文解读] VocGAN: A High-Fidelity Real-time Vocoder with a Hierarchically-nested Adversarial Network
VocGAN 是一种高保真、实时的神经声码器,通过引入分层嵌套的对抗性损失(结合条件与非条件训练,JCU)、多尺度波形生成以及多分辨率STFT损失,对MelGAN进行了改进。其在GPU上推理速度达到实时的416.7倍,在CPU上达到3.24倍,同时在客观指标(MCD、F0 RMSE、PESQ)和主观MOS评分方面显著优于MelGAN和Parallel WaveGAN。
We present a novel high-fidelity real-time neural vocoder called VocGAN. A recently developed GAN-based vocoder, MelGAN, produces speech waveforms in real-time. However, it often produces a waveform that is insufficient in quality or inconsistent with acoustic characteristics of the input mel spectrogram. VocGAN is nearly as fast as MelGAN, but it significantly improves the quality and consistency of the output waveform. VocGAN applies a multi-scale waveform generator and a hierarchically-nested discriminator to learn multiple levels of acoustic properties in a balanced way. It also applies the joint conditional and unconditional objective, which has shown successful results in high-resolution image synthesis. In experiments, VocGAN synthesizes speech waveforms 416.7x faster on a GTX 1080Ti GPU and 3.24x faster on a CPU than real-time. Compared with MelGAN, it also exhibits significantly improved quality in multiple evaluation metrics including mean opinion score (MOS) with minimal additional overhead. Additionally, compared with Parallel WaveGAN, another recently developed high-fidelity vocoder, VocGAN is 6.98x faster on a CPU and exhibits higher MOS.
研究动机与目标
- 开发一种高保真、实时的神经声码器,性能与现有基于GAN的声码器相当或更优,同时保持低推理延迟。
- 解决MelGAN的质量局限性,包括低频和高频分量退化以及与输入梅尔谱图对齐不一致的问题。
- 通过整合联合条件与非条件(JCU)损失等先进训练目标,提升波形一致性和声学保真度。
- 在GPU和CPU上均实现实时性能,且不依赖复杂架构或繁琐训练流程。
- 实现端到端、可投入生产的文本到语音系统,输出高质量语音并保持极低的计算开销。
提出的方法
- 生成器采用多尺度架构,在多个时间分辨率下生成波形,从而更好地捕捉细微和全局的声学特征。
- 采用具有分辨率特异性分支的分层嵌套判别器,以在多尺度上实施对抗训练,提升对多层级声学特性的学习能力。
- 在生成器和判别器上均应用联合条件与非条件(JCU)损失,增强训练稳定性并提升波形的真实性。
- 使用多分辨率短时傅里叶变换(STFT)损失作为辅助目标,以保留频谱细节并提升波形保真度。
- 模型通过对抗损失、特征匹配损失和STFT损失的组合进行训练,同时通过精心设计的架构避免棋盘效应伪影。
- 生成器使用步长大于1的转置卷积,并合理选择卷积核大小和步长,以确保高时间分辨率并避免伪影。
实验结果
研究问题
- RQ1基于GAN的声码器能否在GPU和CPU上均实现高保真语音合成的实时推理?
- RQ2分层嵌套的对抗性训练目标在多大程度上提升了波形质量与输入梅尔谱图的一致性?
- RQ3结合JCU损失与多分辨率STFT损失在多大程度上提升了感知与客观语音质量指标?
- RQ4在CPU推理场景下,VocGAN与MelGAN和Parallel WaveGAN相比,在速度与质量方面表现如何?
- RQ5所提出的架构是否能在无需知识蒸馏或复杂预训练流程的情况下保持高性能?
主要发现
- VocGAN的平均意见得分(MOS)为4.202 ± 0.081,显著优于MelGAN(3.898 ± 0.091)和Parallel WaveGAN(4.098 ± 0.085)。
- 在GTX 1080Ti GPU上,VocGAN的语音合成速度达到实时的416.7倍,远超实时,且效率高于MelGAN。
- 在单核CPU上,VocGAN实现了3.24倍实时推理速度,优于MelGAN,且比Parallel WaveGAN快6.98倍。
- 消融实验证明,将分层嵌套的JCU目标与多分辨率STFT损失结合,对MCD和F0 RMSE指标的提升最大。
- VocGAN生成波形的F0轨迹与真实值更接近,表明其具有更好的基频保持能力。
- VocGAN在降低梅尔倒谱距离(MCD)和F0均方根误差(RMSE)方面优于MelGAN,证明其在频谱与基频准确性方面均有提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。