Skip to main content
QUICK REVIEW

[论文解读] AlignTTS: Efficient Feed-Forward Text-to-Speech System without Explicit Alignment

Zhen Zeng, Jianzong Wang|arXiv (Cornell University)|Mar 4, 2020
Speech Recognition and Synthesis参考文献 27被引用 4
一句话总结

AlignTTS 提出了一种非自回归、基于前馈 Transformer 的文本到语音系统,无需依赖自回归教师模型即可实现最先进性能。通过引入一种受 Baum-Welch 算法启发的新对齐损失,它在训练期间学习精确的文本到梅尔频谱对齐,从而实现并行推理,推理速度比实时快 50 多倍,同时在 MOS 上比 Transformer TTS 提升 0.03。

ABSTRACT

Targeting at both high efficiency and performance, we propose AlignTTS to predict the mel-spectrum in parallel. AlignTTS is based on a Feed-Forward Transformer which generates mel-spectrum from a sequence of characters, and the duration of each character is determined by a duration predictor.Instead of adopting the attention mechanism in Transformer TTS to align text to mel-spectrum, the alignment loss is presented to consider all possible alignments in training by use of dynamic programming. Experiments on the LJSpeech dataset show that our model achieves not only state-of-the-art performance which outperforms Transformer TTS by 0.03 in mean option score (MOS), but also a high efficiency which is more than 50 times faster than real-time.

研究动机与目标

  • 开发一种高效、非自回归的文本到语音系统,避免依赖自回归教师模型。
  • 在不使用显式注意力机制的情况下,改进文本与梅尔频谱之间的对齐学习。
  • 在实现接近实时推理速度的同时,达到最先进语音质量。
  • 设计一种考虑所有可能对齐的训练目标,以提升模型的鲁棒性与准确性。

提出的方法

  • 该模型使用堆叠的前馈 Transformer(FFT)块,结合自注意力机制与一维卷积,实现并行生成梅尔频谱图。
  • 时长预测器估计每个字符的发音时长,该信息由长度调节器在推理过程中用于对齐文本与梅尔频谱。
  • 引入一种受 Baum-Welch 算法启发的对齐损失,通过反向传播时考虑所有可能的对齐方式来训练模型。
  • 使用混合密度网络建模给定文本下梅尔频谱的条件分布,以改善对齐学习。
  • 采用重建损失、时长损失与对齐损失的组合,实现端到端训练。
  • 使用 WaveGlow 作为并行神经声码器,从预测的梅尔频谱图合成波形。

实验结果

研究问题

  • RQ1非自回归 TTS 系统是否能在不使用预训练自回归模型进行对齐引导的情况下实现最先进性能?
  • RQ2一种可微分的对齐损失,若在反向传播中考虑所有可能的对齐方式,是否能提升对齐精度与合成质量?
  • RQ3前馈 Transformer 架构是否能在保持高语音质量的同时实现高速推理?
  • RQ4所提出的对齐损失与基于注意力的对齐方式相比,在精度与鲁棒性方面表现如何?

主要发现

  • AlignTTS 在 LJSpeech 数据集上取得 4.05±0.12 的平均意见得分(MOS),比 Transformer TTS 提高 0.03 MOS。
  • 模型在 0.18 秒内合成约 10 秒语音,相比实时速度实现超过 50 倍的加速。
  • 对齐损失使文本与梅尔频谱之间的对齐比 Transformer TTS 中的注意力机制更精确,如图 3 所示。
  • AlignTTS 的推理速度为每 10 秒语音 0.18 秒,其中 TTS 模型耗时 0.06 秒,WaveGlow 声码器耗时 0.12 秒。
  • 与自回归模型如 Tacotron2(4.58 秒)和 Transformer TTS(3.26 秒)相比,该模型在保持更高质量的同时实现了显著加速。
  • 时长预测器与长度调节器使模型能够控制语速与停顿,从而在推理中实现韵律控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。