Skip to main content
QUICK REVIEW

[论文解读] Multi-task WaveNet: A Multi-task Generative Model for Statistical Parametric Speech Synthesis without Fundamental Frequency Conditions

Yu Gu, Yongguo Kang|arXiv (Cornell University)|Jun 22, 2018
Speech Recognition and Synthesis参考文献 19被引用 5
一句话总结

本文提出 Multi-task WaveNet,一种用于统计参数化语音合成的多任务生成模型,通过联合训练帧级声学特征预测作为次要任务,消除了对外部基频(F0)预测模型的依赖。该方法提升了语音自然度并降低了推理复杂度,在客观与主观评估中均优于原始 WaveNet。

ABSTRACT

This paper introduces an improved generative model for statistical parametric speech synthesis (SPSS) based on WaveNet under a multi-task learning framework. Different from the original WaveNet model, the proposed Multi-task WaveNet employs the frame-level acoustic feature prediction as the secondary task and the external fundamental frequency prediction model for the original WaveNet can be removed. Therefore the improved WaveNet can generate high-quality speech waveforms only conditioned on linguistic features. Multi-task WaveNet can produce more natural and expressive speech by addressing the pitch prediction error accumulation issue and possesses more succinct inference procedures than the original WaveNet. Experimental results prove that the SPSS method proposed in this paper can achieve better performance than the state-of-the-art approach utilizing the original WaveNet in both objective and subjective preference tests.

研究动机与目标

  • 解决原始 WaveNet 在统计参数化语音合成(SPSS)中的局限性,特别是对额外 F0 预测模型的依赖。
  • 降低 WaveNet 基础 TTS 系统中基频预测带来的推理复杂度与误差累积。
  • 通过将 F0 预测作为统一模型中的次要任务,提升语音自然度与表现力。
  • 在不使用基频条件输入的情况下实现更高质量的语音合成,仅依赖语言特征作为输入。
  • 通过消除对独立 F0 估计的需求,提升模型效率与鲁棒性,简化 TTS 流水线。

提出的方法

  • 引入一种多任务学习框架,其中主要任务为自回归波形生成,次要任务为帧级声学特征预测。
  • 通过共享编码器层端到端训练 WaveNet 模型,使模型能够从声学特征中隐式学习与基频相关的模式。
  • 使用空洞因果卷积网络建模原始音频波形中的长程时序依赖关系。
  • 仅以语言特征作为波形生成的条件,而 F0 信息则通过次要声学特征预测任务隐式推断。
  • 用通过联合优化学习到的 F0 表示替代原始 WaveNet 对显式 log F0 条件的依赖。
  • 使用包含波形生成损失与声学特征预测损失的联合损失函数进行模型优化。

实验结果

研究问题

  • RQ1多任务学习框架是否能在不降低语音质量的前提下,消除 WaveNet 基础 SPSS 中对外部 F0 预测模型的依赖?
  • RQ2声学特征与波形生成的联合预测在多大程度上影响语音自然度与语调?
  • RQ3与原始 WaveNet 相比,该方法在多大程度上减少了 F0 预测的误差累积?
  • RQ4通过移除独立的 F0 预测阶段,是否能够提升推理效率?
  • RQ5该模型在主观偏好与客观指标上是否优于原始 WaveNet 及基线系统?

主要发现

  • Multi-task WaveNet 在客观与主观评估中均优于原始 WaveNet,偏好度提升具有统计显著性(在 Corpus A 和 B 中 p < 0.001)。
  • 与原始 WaveNet 相比,该模型在客观失真指标上表现更优(如更低的 MCD 与 PESQ),表明波形保真度更高。
  • 主观偏好测试显示,在两个数据集的成对比较中,MTL-WaveNet 在 95% 的情况下优于 WaveNet,p 值分别为 8.8×10⁻⁷(Corpus A)与 5.6×10⁻⁹(Corpus B)。
  • 通过声学特征预测隐式学习 F0,减少了基频预测的误差累积,提升了语调准确性。
  • 推理过程得到简化与优化,不再需要独立的 F0 预测模型。
  • 改进效果在语音细节与语调方面最为显著,即使整体偏好度提升不总是明显,也表明在细微质量层面实现了显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。