Skip to main content
QUICK REVIEW

[论文解读] Semi-Supervised Generative Modeling for Controllable Speech Synthesis

Raza Habib, Soroosh Mariooryad|arXiv (Cornell University)|Oct 3, 2019
Speech Recognition and Synthesis参考文献 36被引用 15
一句话总结

该论文提出了一种半监督深度生成模型,将神经文本到语音(TTS)与变分自编码器相结合,实现了可靠且可控的语音合成。通过仅对潜在韵律变量施加最少的监督(低至1%或30分钟),该模型能够解耦并控制可解释的属性(如情感、语速和基频变化),同时保持合成质量,实现固定控制因子下的稳定采样。

ABSTRACT

We present a novel generative model that combines state-of-the-art neural text-to-speech (TTS) with semi-supervised probabilistic latent variable models. By providing partial supervision to some of the latent variables, we are able to force them to take on consistent and interpretable purposes, which previously hasn't been possible with purely unsupervised TTS models. We demonstrate that our model is able to reliably discover and control important but rarely labelled attributes of speech, such as affect and speaking rate, with as little as 1% (30 minutes) supervision. Even at such low supervision levels we do not observe a degradation of synthesis quality compared to a state-of-the-art baseline. Audio samples are available on the web.

研究动机与目标

  • 为解决在大规模标注中难以控制语音合成中的高级韵律属性(如情感和语速)的挑战。
  • 克服纯无监督潜在变量模型在TTS中存在不可识别性和可解释性差的问题,后者需要大量后处理才能为学习到的因子赋予意义。
  • 使用最少的人工监督实现对韵律属性的可靠、解耦控制——证明仅需1%的标注数据即可有效实现。
  • 在引入可控性的同时保持高质量的语音合成,避免与最先进全监督基线相比质量下降。
  • 在无可用标注的情况下,将可控性推广至未见过的说话人,实现无需标签的域迁移。

提出的方法

  • 该模型采用条件变分自编码器(VAE)框架,将语音特征 $x$ 建模为由文本 $y$ 条件生成,并引入两个潜在变量:$z_s$(半监督、可控制的韵律)和 $z_u$(完全未观测、建模未受控的韵律变化)。
  • 似然 $p(x|y, z_u, z_s)$ 由带有注意力机制的序列到序列神经网络参数化,类似于Tacotron 2,生成梅尔频谱图帧的自动回归各向同性拉普拉斯分布的均值。
  • 通过随机梯度变分贝叶斯(SGVB)进行半监督训练,其中对有监督数据点的后验分布使用依赖于真实标签的变分分布,而无监督数据点则使用标准后验近似。
  • 对连续 $z_s$ 使用标准正态先验,对离散 $z_s$ 使用均匀分类先验,从而支持连续和离散的可控因子。
  • 通过将解码器条件依赖于 $z_s$ 实现控制,允许在固定 $z_s$ 的情况下采样多样化的韵律变化,实现解耦控制。
  • 系统通过变分下界(ELBO)端到端训练,推理通过采样期间的后验近似完成。

实验结果

研究问题

  • RQ1半监督潜在变量建模是否能够实现对神经TTS中情感和语速等韵律属性的可靠且可解释的控制?
  • RQ2在生成式TTS框架中,实现韵律因子的稳定解耦与控制,所需监督量最少可低至多少?
  • RQ3该模型是否能在仅使用极少标注的情况下维持高质量的语音合成,同时引入可控性?
  • RQ4该模型是否能将可控性泛化到训练期间未见过的说话人,实现无需标签的域迁移?
  • RQ5与启发式方法相比,该概率建模方法是否允许在固定特定控制因子的同时采样多样化的韵律变化?

主要发现

  • 该模型仅使用1%的训练数据进行标注(相当于约30分钟的转录语音),即可实现对情感、语速和基频变化的可靠控制。
  • 语音合成质量与最先进全监督TTS系统相当,经由众包平均意见评分(MOS)验证,即使在最小监督下也未观察到质量下降。
  • 该模型能够在固定特定控制因子的情况下,采样出多样化的韵律变化(如不同情感基调或语速),证明了其解耦生成能力。
  • 该模型成功将可控性迁移至无标注数据的未见说话人,展示了强大的域迁移能力。
  • 该方法支持连续和离散的可控因子,并能对训练分布之外的连续属性范围(如极端情感强度)进行外推。
  • 半监督方法解决了纯无监督模型存在的不可识别性和可解释性问题,消除了为学习到的潜在因子赋予语义意义所需的复杂后处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。