[论文解读] Parallel Tacotron: Non-Autoregressive and Controllable TTS
本文提出 Parallel Tacotron,一种非自回归文本到语音模型,采用基于变分自编码器的残差编码器和轻量卷积,实现高度可并行化的训练与推理。其自然度与自回归的 Tacotron 2 相当,同时推理速度最高提升 13 倍,得益于迭代频谱图损失和 VAE 引导的韵律建模。
Although neural end-to-end text-to-speech models can synthesize highly natural speech, there is still room for improvements to its efficiency and naturalness. This paper proposes a non-autoregressive neural text-to-speech model augmented with a variational autoencoder-based residual encoder. This model, called \emph{Parallel Tacotron}, is highly parallelizable during both training and inference, allowing efficient synthesis on modern parallel hardware. The use of the variational autoencoder relaxes the one-to-many mapping nature of the text-to-speech problem and improves naturalness. To further improve the naturalness, we use lightweight convolutions, which can efficiently capture local contexts, and introduce an iterative spectrogram loss inspired by iterative refinement. Experimental results show that Parallel Tacotron matches a strong autoregressive baseline in subjective evaluations with significantly decreased inference time.
研究动机与目标
- 解决自回归 TTS 模型在现代硬件上训练与推理效率低下的问题。
- 通过建模韵律与上下文信息,无需自回归解码,提升非自回归 TTS 的自然度。
- 减少自回归模型中因教师强制(teacher forcing)导致的训练与推理差异。
- 通过变分自编码器学习解耦的韵律潜在表征,实现可控语音合成。
- 在不牺牲感知质量的前提下实现高速推理,支持实时部署。
提出的方法
- 提出一种非自回归解码器,结合自注意力与轻量卷积(LConv),实现高效、并行推理。
- 引入基于变分自编码器(VAE)的残差编码器,从真实频谱图中建模潜在韵律因素。
- 使用全局 VAE 捕获说话人级别的韵律,使用细粒度音素级别的 VAE 实现帧级别的韵律建模。
- 采用受迭代优化启发的迭代频谱图损失,在训练期间提升梅尔频谱图质量。
- 将轻量卷积(LConv)作为标准自注意力的高效替代方案,减少参数量与推理时间。
- 将非自回归解码器条件化于预测的音素时长、基频(F0)与能量,通过知识蒸馏或直接监督学习获得。
实验结果
研究问题
- RQ1非自回归 TTS 模型是否能在无需自回归解码的情况下,实现与自回归 Tacotron 2 相当的自然度?
- RQ2基于 VAE 的残差编码器在建模韵律与提升非自回归 TTS 自然度方面是否有效?
- RQ3迭代频谱图损失是否能提升非自回归梅尔频谱图生成的质量?
- RQ4轻量卷积与标准自注意力在效率与感知质量方面相比如何?
- RQ5非自回归 TTS 模型在主观评价中能在多大程度上接近人类水平的自然度?
主要发现
- Parallel Tacotron 在主观评价中与 Tacotron 2 表现相当(自然度 MOS:4.40 vs. 4.54),偏好得分为 -0.01,表明质量近乎无法区分。
- 引入全局 VAE 后,MOS 从 4.33(无 VAE)提升至 4.40,进一步引入细粒度 VAE 后提升至 4.42,偏好得分较 Tacotron 2 高 +0.07。
- 迭代频谱图损失在感知质量上带来微小但可测量的提升,尽管在直接对比中未达统计显著性。
- 在 TPU 上推理速度达到 Tacotron 2 的 13 倍,LConv 模型实现 1013× RTF(实时因子),显著优于基于 Transformer 的模型。
- 主观对比中,LConv 基自注意力更受青睐(偏好得分 +0.05),表明其在质量与效率之间具有更优权衡。
- 即使使用合成输出,带有细粒度 VAE 的 Parallel Tacotron 与自然语音相比偏好得分为 -0.01,表明其感知质量已接近人类水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。