Skip to main content
QUICK REVIEW

[논문 리뷰] ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit

Tomoki Hayashi, Ryuichi Yamamoto|arXiv (Cornell University)|2019. 10. 24.
Speech Recognition and Synthesis참고 문헌 41인용 수 12
한 줄 요약

ESPnet-TTS는 ESPnet 프레임워크 기반으로 구축된 오픈소스 엔드 투 엔드 텍스트 투 스피치 툴킷으로, Tacotron2, Transformer TTS, FastSpeech와 같은 최신 모델을 위한 통합적이고 재현 가능한 레시피를 제공한다. LJSpeech에서 평균 평가 점수(MOS) 4.25를 기록하여 주요 툴킷들과 유사한 성능을 보이며, 자동 음성 인식(ASR)과의 원활한 통합을 통해 공동 학습 및 평가를 가능하게 한다.

ABSTRACT

This paper introduces a new end-to-end text-to-speech (E2E-TTS) toolkit named ESPnet-TTS, which is an extension of the open-source speech processing toolkit ESPnet. The toolkit supports state-of-the-art E2E-TTS models, including Tacotron~2, Transformer TTS, and FastSpeech, and also provides recipes inspired by the Kaldi automatic speech recognition (ASR) toolkit. The recipes are based on the design unified with the ESPnet ASR recipe, providing high reproducibility. The toolkit also provides pre-trained models and samples of all of the recipes so that users can use it as a baseline. Furthermore, the unified design enables the integration of ASR functions with TTS, e.g., ASR-based objective evaluation and semi-supervised learning with both ASR and TTS models. This paper describes the design of the toolkit and experimental evaluation in comparison with other toolkits. The experimental results show that our models can achieve state-of-the-art performance comparable to the other latest toolkits, resulting in a mean opinion score (MOS) of 4.25 on the LJSpeech dataset. The toolkit is publicly available at https://github.com/espnet/espnet.

연구 동기 및 목표

  • 음성 합성 분야의 연구를 가속화하기 위해 통합적이고 재현 가능하며 통합 가능한 엔드 투 엔드 텍스트 투 스피치 툴킷을 개발하기 위해.
  • Tacotron2, Transformer TTS, FastSpeech와 같은 최신 E2E-TTS 모델을 표준화된 Kaldi 스타일의 레시피로 지원하기 위해.
  • 기존의 ESPnet ASR 레시피 프레임워크와 일치하는 TTS 레시피 설계를 통해 높은 재현성을 확보하기 위해.
  • ASR 기반 객관적 평가 및 준지도 학습과 같은 작업을 위해 자동 음성 인식(ASR)과의 통합을 촉진하기 위해.
  • 즉각적인 기준 설정 및 시연를 위해 사전 학습된 모델과 생성된 샘플을 제공하기 위해.

제안 방법

  • 툴킷은 ESPnet 프레임워크를 확장하여 데이터 준비, 학습, 추론을 표준화하는 통합적이고 Kaldi 스타일의 레시피를 사용해 엔드 투 엔드 TTS를 지원한다.
  • PyTorch를 백엔드로 사용하여 Tacotron2, Transformer TTS, FastSpeech와 같은 여러 최신 TTS 아키텍처를 구현한다.
  • ASR 모델과의 공동 학습 및 평가가 가능하게 하여 문자 오류율(CER)을 통한 객관적 평가 및 준지도 학습을 가능하게 한다.
  • 고품질 음성 생성을 위한 WaveNet 및 WaveRNN과 같은 신경 음성 합성기(Neural vocoders)를 지원한다.
  • 모든 레시피에 대해 사전 학습된 모델과 추론 샘플을 제공하여 즉각적인 사용성과 재현 가능성을 확보한다.
  • 공유 임bedding 공간과 통합된 학습 파이프라인을 통해 다중 화자 TTS 및 화자 적응을 지원한다.

실험 결과

연구 질문

  • RQ1기존의 ASR 프레임워크 위에 통합적이고 재현 가능하며 통합 가능한 E2E-TTS 툴킷을 구축하여 연구 효율성을 향상시킬 수 있는가?
  • RQ2ESPnet-TTS의 성능은 LJSpeech와 같은 표준 벤치마크에서 청각적 품질과 추론 속도 측면에서 다른 주요 오픈소스 E2E-TTS 툴킷들과 비교해 어떻게 되는가?
  • RQ3ASR와 TTS를 공통 프레임워크를 통해 얼마나 잘 공동 학습 및 평가할 수 있는가?
  • RQ4최소한의 사용자 설정으로도 표준 벤치마크인 LJSpeech에서 최신 성능을 달성할 수 있는가?
  • RQ5모델 아키텍처(예: 순차적 대비 비순차적)가 추론 속도와 품질에 미치는 영향은 어떠한가?

주요 결과

  • ESPnet-TTS는 LJSpeech 데이터셋에서 평균 평가 점수(MOS) 4.25를 기록하여 다른 주요 툴킷들과 유사한 최신 수준의 청각적 품질을 입증하였다.
  • 음소 입력을 사용한 Transformer TTS 모델(v3)이 가장 높은 MOS(4.25)를 기록하여 Tacotron2 및 기타 기준 모델들을 능가하였다.
  • FastSpeech는 가장 빠른 추론 속도를 기록하였으며, GPU에서 실시간 요소(RTF)가 0.003이었는데, 이는 Transformer TTS보다 200배, Tacotron2보다 30배 더 빠른 속도였다.
  • Tacotron2와 Transformer TTS 모델은 유사한 MOS 점수(4.14–4.20)를 기록하여 아키텍처 간의 높은 성능 일관성을 보였다.
  • 기존의 SPSS 시스템(예: Merlin)의 MOS 2.69와 비교해 훨씬 뛰어난 성능을 보이며 엔드 투 엔드 학습의 우수성을 확인하였다.
  • ASR와 TTS의 통합을 통해 문자 오류율(CER)을 통한 객관적 평가가 가능해졌으며, 공동 학습 및 평가의 가능성은 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.