Skip to main content
QUICK REVIEW

[논문 리뷰] ESPnet2-TTS: Extending the Edge of TTS Research

Tomoki Hayashi, Ryuichi Yamamoto|arXiv (Cornell University)|2021. 10. 15.
Topic Modeling참고 문헌 47인용 수 28
한 줄 요약

ESPnet2-TTS는 실시간 전처리, Model Zoo, 그리고 공동 학습을 통해 성능과 재현성을 향상시키는 엔드-투-엔드 TTS 도구상자이다. 영어와 일본어에 대한 실험은 단일/다중 화자 설정에서도 ground-truth에 필적하는 결과를 보인다.

ABSTRACT

This paper describes ESPnet2-TTS, an end-to-end text-to-speech (E2E-TTS) toolkit. ESPnet2-TTS extends our earlier version, ESPnet-TTS, by adding many new features, including: on-the-fly flexible pre-processing, joint training with neural vocoders, and state-of-the-art TTS models with extensions like full-band E2E text-to-waveform modeling, which simplify the training pipeline and further enhance TTS performance. The unified design of our recipes enables users to quickly reproduce state-of-the-art E2E-TTS results. We also provide many pre-trained models in a unified Python interface for inference, offering a quick means for users to generate baseline samples and build demos. Experimental evaluations with English and Japanese corpora demonstrate that our provided models synthesize utterances comparable to ground-truth ones, achieving state-of-the-art TTS performance. The toolkit is available online at https://github.com/espnet/espnet.

연구 동기 및 목표

  • 유연하고 확장 가능한 툴킷으로 통합 작업 설계를 제공하여 엔드투엔드 TTS를 발전시키는 것을 목표로 한다.
  • 통합 레시피와 사전 학습 모델을 통해 최첨단 TTS 결과를 빠르게 재현할 수 있도록 한다.
  • 영어와 일본어 코퍼스에서 E2E-T2W 모델과 확장 기능의 성능을 입증한다.
  • 파이프라인을 간소화하고 품질을 향상시키기 위해 신경 보코더와의 공동 학습을 강조한다.

제안 방법

  • 온더-플라이(preprocessing) 전처리와 빠른 모델 액세스를 위한 Model Zoo를 가능하게 하는 unified task design으로 ESPnet2-TTS를 도입한다.
  • 자 autoregressive 및 non-autoregressive T2M 모델(Tacotron 2, Transformer-TTS, FastSpeech, FastSpeech 2, Conformer-FastSpeech 변형)과 화자 임베딩, X-vectors, GSTs를 통한 멀티스피커 확장을 지원한다.
  • M2W 보코더(Griffin-Lim, Parallel WaveGAN, MelGAN, StyleMelGAN, HiFi-GAN 및 멀티-밴드 변형)와 무작위 윈도우 분별기를 사용하는 Joint-T2W 학습을 제공한다.
  • Conformer 인코더를 가진 VITS와 같은 E2E-T2W 모델, 풀-밴드 파형 모델링, 사전 학습된 화자 임베딩을 이용한 제로샷 화자 적응을 포함한다.
  • 평가 지표(MCD, F0 RMSE, CER, MOS)와 웹 기반 MOS 테스트에 대한 가이드를 제공하고, 사전 학습 가중치 및 데모를 출시한다.

실험 결과

연구 질문

  • RQ1ESPnet2-TTS가 다국어 및 다화자 설정에서 최첨단 E2E-TTS 결과를 재현할 수 있는가?
  • RQ2T2M 및 M2W 구성 요소의 공동 학습이 독립 학습에 비해 자연스러움과 intelligibility에 어떤 영향을 미치는가?
  • RQ3Conformer 아키텍처, 풀-밴드 파형 모델링, 제로샷 화자 적응을 사용한 경우 TTS 성능에 미치는 영향은 무엇인가?
  • RQ4영어와 일본어 코퍼스에서 단일화자, 다중화자 및 적응 시나리오의 비교는 어떠한가?
  • RQ5ESPnet2-TTS 생태계 내 AR과 NAR T2M 모델 간의 트레이드오프는 무엇인가?

주요 결과

  • 영어 및 일본어 코퍼스에서 ground-truth에 필적하는 여러 설정의 새로운 최첨단 유사 성능.
  • T2M과 M2W의 공동 학습(Joint-T2W)은 자연스러움을 향상시키고 정렬/불일치 문제를 감소시키며, 특히 비 autoregressive 모델에서 효과가 큼.
  • Conformer 기반 확장(Conformer-FastSpeech, Conformer-FastSpeech 2)은 품질을 유지하면서 추론 속도를 높임.
  • 풀-밴드 파형 모델링 및 제로샷 화자 적응을 갖춘 VITS 기반 E2E-T2W는 MOS 및 intelligibility에서 경쟁력 있는 성능을 보이며, G2P 정확도에 따라 달라짐.
  • 다중 화자 평가에서 X-vectors가 화자 유사성 및 자연스러움을 향상시키는 경향이 있으며, Seen/Unseen 화자 결과에서 많은 경우 X-VITS가 더 유리함.
  • 영어, 일본어 및 적응 실험 전반에서 재현성과 넓은 언어 범위를 입증.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.