Skip to main content
QUICK REVIEW

[论文解读] Statistical Parametric Speech Synthesis Using Generative Adversarial Networks Under A Multi-task Learning Framework

Shan Yang, Lei Xie|arXiv (Cornell University)|Jul 6, 2017
Speech Recognition and Synthesis参考文献 30被引用 6
一句话总结

本文提出了一种多任务学习框架,将生成对抗网络(GAN)与均方误差(MSE)损失相结合,用于统计参数化语音合成。通过联合优化 GAN 的判别器以提升感知质量,同时利用 MSE 损失稳定训练过程,该方法生成的语音比基线系统更加自然,在主观听音测试中得到了显著验证。

ABSTRACT

In this paper, we aim at improving the performance of synthesized speech in statistical parametric speech synthesis (SPSS) based on a generative adversarial network (GAN). In particular, we propose a novel architecture combining the traditional acoustic loss function and the GAN's discriminative loss under a multi-task learning (MTL) framework. The mean squared error (MSE) is usually used to estimate the parameters of deep neural networks, which only considers the numerical difference between the raw audio and the synthesized one. To mitigate this problem, we introduce the GAN as a second task to determine if the input is a natural speech with specific conditions. In this MTL framework, the MSE optimization improves the stability of GAN, and at the same time GAN produces samples with a distribution closer to natural speech. Listening tests show that the multi-task architecture can generate more natural speech that satisfies human perception than the conventional methods.

研究动机与目标

  • 为解决统计参数化语音合成(SPSS)中的感知缺陷问题,即最小化数值损失(如 MSE)并不能保证更好的人类感知。
  • 通过集成传统的 MSE 损失函数,缓解 GAN 基语音合成中常见的训练不稳定与模式崩溃问题。
  • 通过利用判别器捕捉真实语音与合成语音之间感知差异的能力,提升语音自然度。
  • 探索多任务学习(MTL)框架是否能同时稳定训练并提升 TTS 的感知质量。
  • 评估在 MTL 框架下基于 GAN 的生成方法在客观与主观指标上是否优于标准 BLSTM 基语音合成系统及其他 GAN 变体。

提出的方法

  • 该框架采用多任务学习设置,其中生成器(声学模型)同时使用均方误差(MSE)损失和 GAN 对抗损失进行训练。
  • 生成器基于语言特征生成语音参数,而判别器则评估生成的语音是真实还是合成的,从而提供反馈以提升感知质量。
  • MSE 损失确保数值稳定性,并通过引导生成器更准确地重建目标语音特征,防止模式崩溃。
  • GAN 损失应用于声码器输出,使判别器能够学习自然语音波形与合成语音波形之间的感知差异。
  • 使用条件语言特征引导生成器,确保合成过程中内容与语调得以保留。
  • 训练过程交替优化生成器在 MSE 和对抗目标上的表现,同时更新判别器以区分真实样本与生成样本。

实验结果

研究问题

  • RQ1在多任务学习框架中,将 GAN 与传统 MSE 损失结合,是否能提升 SPSS 中合成语音的感知质量?
  • RQ2引入 GAN 判别器是否能带来更自然的语调,并减少如“嗡嗡声”等感知伪影?
  • RQ3该 MTL 框架如何缓解 GAN 基语音合成中常见的训练不稳定与模式崩溃问题?
  • RQ4在主观听音测试中,基于 GAN 的方法是否优于基线 BLSTM 基语音合成系统及其他 GAN 变体?
  • RQ5与训练于辅助任务(如反欺骗,ASV)的判别器相比,能够区分真实与合成语音的判别器是否更具有效性?

主要发现

  • 所提出的 MTL 框架在主观语音质量方面显著优于基线 BLSTM 基语音合成系统,A/B 偏好测试中 p 值 < 0.0001。
  • 听者更偏好基于 GAN 的系统而非基于 ASV 的方法,表明 GAN 的判别器更能捕捉语音质量的感知差异。
  • 基于 GAN 的系统生成的合成语音在全局方差(GV)值上更接近自然语音,特别是在前几个梅尔倒谱系数上,表明频谱包络建模得到改善。
  • GAN-PC 变体(将音素分类作为判别器输入)表现出显著性能下降(p < 0.001),表明判别器中引入语言条件会损害感知质量。
  • 在直接对比中,BLSTM 系统略胜于 GAN-PC(p = 0.0253),证实向判别器中添加音素标签会适得其反,不利于感知质量提升。
  • 该框架在客观损失值上与基线保持相当,表明性能提升源于感知增益而非数值优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。