[论文解读] EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture
EfficientTTS 提出了一种非自回归文本到语音架构,通过使用索引映射向量的新型单调对齐建模方法,实现端到端训练,从而在无需外部对齐器的情况下实现稳定、高效的训练与推理,合成语音质量、训练效率和合成速度均优于 Tacotron 2 和 Glow-TTS。
In this work, we address the Text-to-Speech (TTS) task by proposing a non-autoregressive architecture called EfficientTTS. Unlike the dominant non-autoregressive TTS models, which are trained with the need of external aligners, EfficientTTS optimizes all its parameters with a stable, end-to-end training procedure, while allowing for synthesizing high quality speech in a fast and efficient manner. EfficientTTS is motivated by a new monotonic alignment modeling approach (also introduced in this work), which specifies monotonic constraints to the sequence alignment with almost no increase of computation. By combining EfficientTTS with different feed-forward network structures, we develop a family of TTS models, including both text-to-melspectrogram and text-to-waveform networks. We experimentally show that the proposed models significantly outperform counterpart models such as Tacotron 2 and Glow-TTS in terms of speech quality, training efficiency and synthesis speed, while still producing the speeches of strong robustness and great diversity. In addition, we demonstrate that proposed approach can be easily extended to autoregressive models such as Tacotron 2.
研究动机与目标
- 解决依赖外部对齐器的非自回归 TTS 模型在训练中出现的不稳定与低效问题。
- 开发一种完全端到端的非自回归 TTS 框架,实现在不牺牲语音质量的前提下快速训练与推理。
- 提出一种新颖的单调对齐建模技术,计算开销极低,以提升对齐准确性与模型稳定性。
- 在多种 TTS 变体中验证所提架构的有效性,包括文本到梅尔频谱图与文本到波形模型。
- 证明该单调对齐方法可扩展至自回归模型(如 Tacotron 2),以提升其鲁棒性与性能。
提出的方法
- 提出一种基于索引映射向量(IMV)的单调对齐建模方法,通过在注意力机制中引入 IMV 来强制实现单调性,且不增加计算量。
- 将基于 IMV 的注意力机制整合到完全卷积的非自回归编码器-解码器框架中,实现并行序列生成。
- 通过单一网络端到端训练整个模型,无需外部对齐模型或事后对齐提取。
- 设计一系列模型:EFTS-CNN(卷积型)、EFTS-Flow(基于归一化流)和 EFTS-Wav(端到端波形生成)。
- 利用 IMV 同时生成硬性与软性单调对齐,其中硬性对齐(HMA)带来更强的性能提升。
- 通过可控推理实现语音多样性:调整对齐策略、缩放对齐位置,以及调节 EFTS-Flow 中潜在变量的温度。
实验结果
研究问题
- RQ1非自回归 TTS 模型是否能在不依赖外部对齐器的情况下实现高质量语音合成与高效训练?
- RQ2所提出的基于索引映射向量的单调对齐建模方法在提升训练稳定性与推理质量方面的有效性如何?
- RQ3该单调对齐方法在处理具有挑战性的文本输入时,能在多大程度上增强 TTS 模型的鲁棒性?
- RQ4所提架构是否可扩展至自回归模型(如 Tacotron 2)以提升其性能?
- RQ5与使用风格或说话人嵌入的现有方法相比,该模型在生成多样化语音样本方面的能力如何?
主要发现
- EFTS-HMA 在 270k 步训练时达到 0.095 的损失,显著优于 EFTS-SMA(450k 步时损失为 0.33)和 EFTS-NM(未能收敛)。
- 与 Tacotron 2(13 次重复、7 次跳过、5 次误读,错误率为 50%)相比,EFTS-CNN 将鲁棒性错误降至 0 次重复、0 次跳过,仅 2 次误读。
- 所提出的单调对齐方法将 Tacotron 2 的错误率从 50% 降低至 8%,证明其显著提升了鲁棒性。
- EFTS-HMA 在推理速度与语音质量方面优于 EFTS-SMA 和基线模型,且对齐准确性无下降。
- EFTS-Flow 通过调节潜在变量的温度,实现可控的语音多样性,使同一文本可生成多种语音。
- 该模型系列(包括 EFTS-Wav)实现了高质量、高效率的端到端文本到波形语音合成,证明了该架构的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。