Skip to main content
QUICK REVIEW

[论文解读] Deep Text-to-Speech System with Seq2Seq Model

Wang Gary|arXiv (Cornell University)|Mar 11, 2019
Speech Recognition and Synthesis参考文献 10被引用 8
一句话总结

该论文提出了一种轻量级、基于RNN的端到端文本到语音系统,采用查询-键注意力机制和引导注意力掩码,以加速训练并改善注意力对齐。该模型仅用3小时即达到接近人类水平的语音质量(MOS 3.44),训练速度比Tacotron 2快3倍,且参数量仅450万,远低于Tacotron 2的1300万,展示了在不牺牲音质的前提下显著提升效率。

ABSTRACT

Recent trends in neural network based text-to-speech/speech synthesis pipelines have employed recurrent Seq2seq architectures that can synthesize realistic sounding speech directly from text characters. These systems however have complex architectures and takes a substantial amount of time to train. We introduce several modifications to these Seq2seq architectures that allow for faster training time, and also allows us to reduce the complexity of the model architecture at the same time. We show that our proposed model can achieve attention alignment much faster than previous architectures and that good audio quality can be achieved with a model that's much smaller in size. Sample audio available at https://soundcloud.com/gary-wang-23/sets/tts-samples-for-cmpt-419.

研究动机与目标

  • 在保持高音频质量的前提下,减少基于RNN的文本到语音系统中的训练时间与模型复杂度。
  • 通过引导注意力掩码机制,加速训练过程中注意力对齐的收敛。
  • 通过推理时强制逐步注意力机制,提升解码过程的鲁棒性。
  • 证明更小的模型可实现与Tacotron 2等更大、更复杂的基线模型相当或更优的性能。
  • 为计算资源有限的环境提供一种更高效、端到端的TTS解决方案。

提出的方法

  • 用受Transformer启发的查询-键注意力机制替代传统的定位敏感加性注意力,采用缩放点积注意力。
  • 引入一种引导注意力掩码,在训练过程中对注意力错位进行惩罚,从而加速注意力对齐的收敛。
  • 应用单调注意力损失,以促进早期且稳定的注意力对齐,减少训练不稳定性。
  • 使用两层双向LSTM/GRU编码器,将输入文本嵌入为键向量与值向量,用于注意力计算。
  • 采用两层单向LSTM/GRU解码器,实现自回归生成,其注意力查询由解码器隐藏状态生成。
  • 在推理阶段实施强制逐步注意力机制,防止注意力跳过或卡顿在某些字符上,确保长序列生成的连贯性。

实验结果

研究问题

  • RQ1查询-键注意力机制是否能减少基于RNN的TTS模型的训练时间并改善注意力对齐?
  • RQ2与标准注意力相比,引导注意力掩码是否能显著加速注意力对齐的收敛?
  • RQ3参数更少的小型模型能否实现与Tacotron 2等大型模型相当的语音质量?
  • RQ4强制逐步注意力在提升长序列推理稳定性方面有多有效?
  • RQ5在不牺牲感知语音质量的前提下,训练时间能被压缩到何种程度?

主要发现

  • 所提模型的平均意见评分(MOS)为3.440 ± 0.182,表明其语音质量接近人类水平,尽管模型架构更小,但仍与Tacotron 2的3.528 ± 0.179相当。
  • 实现清晰注意力对齐的训练时间缩短至约3小时,比Tacotron 2估计的15小时快至少三倍。
  • 模型仅使用450万个参数,较Tacotron 2的1300万个参数显著减少,展现出极高的参数效率。
  • 引导注意力掩码使注意力对齐更快且更稳定,经10,000个训练步骤后的注意力图可视化结果已明确证实。
  • 推理阶段的强制逐步注意力机制可防止注意力跳过或卡顿在字符上,显著提升了长句生成的鲁棒性。
  • 该模型在训练速度与模型规模方面优于多个基线模型,同时保持了具有竞争力的感知质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。