Skip to main content
QUICK REVIEW

[论文解读] ESPnet2-TTS: Extending the Edge of TTS Research

Tomoki Hayashi, Ryuichi Yamamoto|arXiv (Cornell University)|Oct 15, 2021
Topic Modeling参考文献 47被引用 28
一句话总结

ESPnet2-TTS 是一个端到端的文本转语音工具包,具备随时预处理、模型库,以及具有联合训练的最先进 TTS 模型,以提升性能和可重复性;在英语和日语上的实验在单说话人/多说话人设置下显示出与 ground-truth 相当的结果。

ABSTRACT

This paper describes ESPnet2-TTS, an end-to-end text-to-speech (E2E-TTS) toolkit. ESPnet2-TTS extends our earlier version, ESPnet-TTS, by adding many new features, including: on-the-fly flexible pre-processing, joint training with neural vocoders, and state-of-the-art TTS models with extensions like full-band E2E text-to-waveform modeling, which simplify the training pipeline and further enhance TTS performance. The unified design of our recipes enables users to quickly reproduce state-of-the-art E2E-TTS results. We also provide many pre-trained models in a unified Python interface for inference, offering a quick means for users to generate baseline samples and build demos. Experimental evaluations with English and Japanese corpora demonstrate that our provided models synthesize utterances comparable to ground-truth ones, achieving state-of-the-art TTS performance. The toolkit is available online at https://github.com/espnet/espnet.

研究动机与目标

  • 推进端到端 TTS,通过提供一个灵活、可扩展的工具包实现统一的任务设计。
  • 通过统一的配方和预训练模型实现对最先进 TTS 结果的快速复现。
  • 在英语和日语语料库上展示 E2E-T2W 模型及扩展的性能。
  • 强调与神经声码器的联合训练,以简化管道并提升质量。

提出的方法

  • 引入具有统一任务设计的 ESPnet2-TTS,支持随时预处理并提供用于快速模型获取的模型库。
  • 同时支持自回归和非自回归的 T2M 模型(Tacotron 2、Transformer-TTS、FastSpeech、FastSpeech 2、Conformer-FastSpeech 变体)以及通过说话人嵌入、X-vectors 和 GSTs 的多说话人扩展。
  • 提供 M2W 声码器(Griffin-Lim、Parallel WaveGAN、MelGAN、StyleMelGAN、HiFi-GAN 及多带变体)以及使用随机窗口判别器的 Joint-T2W 训练。
  • 结合带有 Conformer 编码器、全带波形建模的 E2E-T2W 模型如 VITS,以及使用预训练说话人嵌入实现的零样本说话人自适应。
  • 提供评估指标(MCD、F0 RMSE、CER、MOS)以及网页端 MOS 测试的指导;发布预训练权重和演示。

实验结果

研究问题

  • RQ1ESPnet2-TTS 是否能够在多语言和多说话人设置下再现最先进的 E2E-TTS 结果?
  • RQ2T2M 和 M2W 组件的联合训练对自然度和清晰度相较于单独训练有何影响?
  • RQ3使用 Conformer 架构、全带波形建模与零样本说话人自适应对 TTS 性能有何影响?
  • RQ4英语和日语语料库中单说话人、多说话人与自适应情景的比较如何?
  • RQ5在 ESPnet2-TTS 生态中 AR 与 NAR T2M 模型之间的权衡有哪些?

主要发现

  • 在英语和日语语料库上实现了接近最先进水平的性能,在多种设定下结果可与 ground-truth 相当。
  • T2M 与 M2W 的联合训练(Joint-T2W)提升自然度并减少对齐/错配问题,尤其对非自回归模型有效。
  • 基于 Conformer 的扩展(Conformer-FastSpeech、Conformer-FastSpeech 2)在保持质量的同时实现更快的推理。
  • 基于 VITS 的 E2E-T2W,带全带波形建模与零样本说话人自适应,达到具有竞争力的 MOS 与清晰度;性能依赖于 G2P 的准确性。
  • 多说话人评估表明 X-vectors 能增强说话人相似度和自然度,且 seen/unseen 说话人结果在许多情况下偏向 X-VITS。
  • 广泛的英语、日语及自适应实验显示可重复性和广泛语言覆盖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。