[论文解读] A New GAN-based End-to-End TTS Training Algorithm
该论文提出了一种基于GAN的端到端TTS训练算法,通过联合训练生成器和判别器在真实序列和生成序列上,引入Professor Forcing以缓解自回归TTS模型中的暴露偏差问题。该方法在主观评估中优于教师强制和调度采样,提升了语音自然度(CMOS +0.1)和泛化能力(不清晰率从11.1%降至4%)。
End-to-end, autoregressive model-based TTS has shown significant performance improvements over the conventional one. However, the autoregressive module training is affected by the exposure bias, or the mismatch between the different distributions of real and predicted data. While real data is available in training, but in testing, only predicted data is available to feed the autoregressive module. By introducing both real and generated data sequences in training, we can alleviate the effects of the exposure bias. We propose to use Generative Adversarial Network (GAN) along with the key idea of Professor Forcing in training. A discriminator in GAN is jointly trained to equalize the difference between real and predicted data. In AB subjective listening test, the results show that the new approach is preferred over the standard transfer learning with a CMOS improvement of 0.1. Sentence level intelligibility tests show significant improvement in a pathological test set. The GAN-trained new model is also more stable than the baseline to produce better alignments for the Tacotron output.
研究动机与目标
- 解决自回归端到端TTS中的暴露偏差问题,即训练时使用真实序列,而推理时依赖预测序列。
- 提升模型在未见或复杂输入序列(如长句或病态输入)下的泛化能力和鲁棒性。
- 通过减少真实语音序列与生成语音序列之间的分布差异,提升语音质量和自然度。
- 开发一种训练框架,以稳定注意力对齐并减少长序列生成中的误差累积。
提出的方法
- 提出一种基于GAN的训练框架,其中生成器(TTS模型)在教师强制(真实输入)和自由运行(预测输入)两种模式下生成语音序列。
- 训练判别器以区分来自真实序列(教师强制)的隐藏状态和输出,与来自生成序列(自由运行)的隐藏状态和输出,从而最小化分布差异。
- 通过对抗训练对齐真实数据与生成数据的分布,通过在训练中让生成器接触自身预测,减少暴露偏差。
- 应用Professor Forcing原则,联合优化生成器在似然最大化和对抗真实性两个目标上的表现。
- 将基于GAN的训练与调度采样(SS)结合,进一步提升泛化能力,同时不降低语音质量。
- 采用两阶段训练目标:(1) 在真实序列上最大化似然;(2) 最小化判别器损失,使生成序列与真实序列难以区分。
实验结果
研究问题
- RQ1通过在训练中引入生成序列,基于GAN的对抗训练是否能有效减少自回归TTS模型中的暴露偏差?
- RQ2与教师强制和调度采样相比,所提出的基于GAN的训练方法在语音自然度和可懂性方面表现如何?
- RQ3将GAN训练与调度采样结合是否能在保持高语音质量的同时提升模型泛化能力?
- RQ4所提出的方法在多大程度上能稳定注意力对齐并减少长序列或复杂输入序列中的误差累积?
主要发现
- TF-GAN模型相比标准教师强制,CMOS得分提升+0.1,偏好率提高5.33%(p=0.02)。
- TF-GAN模型将病理测试集上的不清晰率从11.1%(TF)降低至4%,显著改善了泛化能力。
- 仅使用调度采样会降低语音质量(CMOS -0.04),但能提升泛化能力,表明质量与鲁棒性之间存在权衡。
- SS-GAN组合在保持高语音质量的同时,将不清晰率降低至2.22%,表明在不损失质量的前提下提升了泛化能力。
- 超过50%涉及长句或复杂句子的不良案例在应用基于GAN的训练后得到修复,表明对长上下文输入的鲁棒性显著提升。
- 通过最小化真实数据与生成数据之间的分布差异,该方法稳定了注意力对齐,减少了误差传播,尤其在长序列解码中表现显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。