Skip to main content
QUICK REVIEW

[论文解读] Probability density distillation with generative adversarial networks for high-quality parallel waveform generation

Ryuichi Yamamoto, Eunwoo Song|arXiv (Cornell University)|Apr 9, 2019
Speech and Audio Processing参考文献 31被引用 15
一句话总结

本文提出了一种基于 GAN 的概率密度蒸馏(PDD)方法,用于 WaveNet 基的并行波形生成,其中使用逆自回归流(IAF)学生模型作为 GAN 生成器,与传统 PDD 联合训练,以提升语音质量。该方法在主观质量上表现优异,MOS 达到 4.186,甚至优于自回归教师模型 WaveNet。

ABSTRACT

This paper proposes an effective probability density distillation (PDD) algorithm for WaveNet-based parallel waveform generation (PWG) systems. Recently proposed teacher-student frameworks in the PWG system have successfully achieved a real-time generation of speech signals. However, the difficulties optimizing the PDD criteria without auxiliary losses result in quality degradation of synthesized speech. To generate more natural speech signals within the teacher-student framework, we propose a novel optimization criterion based on generative adversarial networks (GANs). In the proposed method, the inverse autoregressive flow-based student model is incorporated as a generator in the GAN framework, and jointly optimized by the PDD mechanism with the proposed adversarial learning method. As this process encourages the student to model the distribution of realistic speech waveform, the perceptual quality of the synthesized speech becomes much more natural. Our experimental results verify that the PWG systems with the proposed method outperform both those using conventional approaches, and also autoregressive generation systems with a well-trained teacher WaveNet.

研究动机与目标

  • 通过教师-学生框架提升并行波形生成(PWG)系统的主观质量。
  • 解决传统 PDD 方法的局限性,即由于 Kullback-Leibler 散度(KLD)最小化,无法超越教师模型的质量。
  • 利用生成对抗网络(GAN)的分布建模能力,提升合成语音的真实感。
  • 通过联合优化 PDD、辅助损失和对抗训练,提升学生模型在样本级的真实感。

提出的方法

  • 采用逆自回归流(IAF)模型作为学生网络,以实现并行、实时的语音波形生成。
  • 将 IAF 学生模型作为 GAN 框架中的生成器,通过一种新型对抗损失训练,以建模自然语音波形的分布。
  • 学生模型通过三种组件联合优化:基于 KLD 的 PDD、帧级 STFT 损失(辅助损失)和基于 GAN 的对抗损失。
  • 损失函数结合 KLD、STFT 损失和对抗损失,并使用可学习的权重系数,以平衡分布匹配、频谱保真度和主观真实感。
  • 训练过程从完整的 KLD 指导开始,并随着训练进程逐步降低 KLD 权重,以允许学生模型探索超出教师分布的区域。
  • 所提方法通过利用 GAN 建模复杂、逼真的语音分布的能力,使学生模型在主观质量上超越教师模型。

实验结果

研究问题

  • RQ1对抗训练能否使基于 IAF 的并行波形生成在主观质量上超越教师 WaveNet?
  • RQ2将基于 GAN 的对抗损失与传统 PDD 及辅助损失结合,对语音合成质量有何影响?
  • RQ3通过联合优化,非自回归 IAF 学生模型能否在主观质量上超越自回归教师 WaveNet?
  • RQ4在训练目标中,KLD 蒸馏、频谱损失和对抗损失的最优平衡是什么?

主要发现

  • 所提的 KLAXAD 方法取得了 4.186 的平均意见得分(MOS),显著优于传统 PDD 方法及自回归教师 WaveNet 模型。
  • A/B/X 偏好测试确认,经过权重优化的版本(KLAXAD*)在主观质量上优于原始 KLAXAD 设置。
  • 仅使用辅助损失训练的 IAF 学生模型(AX)表现最差,凸显了 PDD 和对抗训练在高质量合成中的必要性。
  • KLD 蒸馏、STFT 损失和对抗损失的结合显著提升了主观质量,使学生模型在 MOS 上超越了教师模型。
  • 在训练过程中降低 KLD 权重系数,使学生模型能够生成更自然的语音,表明对教师分布的过度依赖会限制质量提升。
  • 结果表明,基于 GAN 的对抗训练能有效增强非自回归语音生成的真实感,即使学生模型是从高质量教师模型蒸馏而来。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。