[논문 리뷰] EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture
EfficientTTS는 인덱스 매핑 벡터를 사용한 새로운 단조성 정렬 모델링 방법을 통해 외부 정렬기 없이 안정적이고 효율적인 훈련과 추론을 가능하게 하는 비자기적 텍스트-to-음성 아키텍처를 제안한다. 이는 종합적인 훈련을 통해 고품질의 빠른 음성 합성 성능을 달성하며, Tacotron 2와 Glow-TTS보다 음성 품질, 훈련 효율성, 합성 속도 면에서 뛰어나다.
In this work, we address the Text-to-Speech (TTS) task by proposing a non-autoregressive architecture called EfficientTTS. Unlike the dominant non-autoregressive TTS models, which are trained with the need of external aligners, EfficientTTS optimizes all its parameters with a stable, end-to-end training procedure, while allowing for synthesizing high quality speech in a fast and efficient manner. EfficientTTS is motivated by a new monotonic alignment modeling approach (also introduced in this work), which specifies monotonic constraints to the sequence alignment with almost no increase of computation. By combining EfficientTTS with different feed-forward network structures, we develop a family of TTS models, including both text-to-melspectrogram and text-to-waveform networks. We experimentally show that the proposed models significantly outperform counterpart models such as Tacotron 2 and Glow-TTS in terms of speech quality, training efficiency and synthesis speed, while still producing the speeches of strong robustness and great diversity. In addition, we demonstrate that proposed approach can be easily extended to autoregressive models such as Tacotron 2.
연구 동기 및 목표
- 외부 정렬기를 의존하는 비자기적 TTS 모델에서 발생하는 훈련 불안정성과 비효율성 문제를 해결한다.
- 외부 정렬기 없이도 음성 품질을 손상시키지 않고 빠른 훈련과 추론을 가능하게 하는 완전한 종합적 비자기적 TTS 프레임워크를 개발한다.
- 최소한의 계산 부담으로 정렬 정확도와 모델 안정성을 향상시키는 새로운 단조성 정렬 모델링 기법을 도입한다.
- 텍스트-멜스펙트로그램 및 텍스트-웨이브폼 모델을 포함한 다양한 TTS 변종에 대해 제안된 아키텍처의 유효성을 입증한다.
- 제안된 단조성 정렬 기법이 Tacotron 2와 같은 자기적 모델로 확장되어 그들의 강건성과 성능을 향상시킬 수 있음을 보여준다.
제안 방법
- 계산량을 증가시키지 않고도 주의 메커니즘의 단조성을 강제하기 위해 색인 매핑 벡터(IMV)를 사용한 단조성 정렬 모델링 방법을 제안한다.
- 병렬 시퀀스 생성을 위한 완전히 컨volutional인 비자기적 인코더-디코더 프레임워크에 IMV 기반 주의 메커니즘을 통합한다.
- 외부 정렬 모델이나 후행 정렬 추출이 필요 없도록 단일 네트워크를 사용해 전체 모델을 종합적으로 훈련시킨다.
- EFTS-CNN(컨volutional), EFTS-Flow(노멀라이징 플로우 기반), EFTS-Wav(종합적 웨이브폼 생성)를 포함한 모델 패밀리 설계.
- IMV를 사용해 하드 및 소프트 단조성 정렬을 생성하며, 하드 정렬(HMA)이 더 큰 성능 향상을 제공한다.
- EFTS-Flow의 잠재 변수의 온도 조정, 정렬 방식의 다양화, 정렬된 위치의 스케일링을 통해 제어 가능한 추론을 가능하게 하여 음성 다양성을 확보한다.
실험 결과
연구 질문
- RQ1외부 정렬기를 의존하지 않고도 비자기적 TTS 모델이 고품질의 음성 합성과 높은 훈련 효율성을 달성할 수 있는가?
- RQ2색인 매핑 벡터를 사용한 제안된 단조성 정렬 모델링 기법이 훈련 안정성과 추론 품질 향상에 얼마나 효과적인가?
- RQ3단조성 정렬 기법이 어려운 텍스트 입력을 처리하는 데 있어 TTS 모델의 강건성을 얼마나 향상시킬 수 있는가?
- RQ4제안된 아키텍처가 Tacotron 2와 같은 자기적 모델로 확장되어 성능을 향상시킬 수 있는가?
- RQ5스타일 또는 스피커 임베딩을 사용하는 기존 방법과 비교해, 모델이 다양한 음성 샘플을 생성하는 능력은 어떠한가?
주요 결과
- EFTS-HMA는 270,000 스텝에서 훈련 손실 0.095를 기록하며, EFTS-SMA(450,000 스텝에서 0.33)와 EFTS-NM(수렴 실패)를 크게 앞서나간다.
- EFTS-CNN는 타코트론 2(13회 반복, 7회 건너뛰기, 5회 발음 오류, 오류율 50%) 대비 강건성 오류를 감소시켜 반복 0회, 건너뛰기 0회, 오류 2회로 개선한다.
- 제안된 단조성 정렬 기법을 통해 타코트론 2의 오류율을 50%에서 8%로 감소시켜 강건성을 향상시켰다.
- EFTS-HMA는 정렬 정확도에 손상이 없이 EFTS-SMA 및 기준 모델보다 더 빠른 추론 속도와 뛰어난 음성 품질을 달성한다.
- EFTS-Flow는 잠재 변수의 온도 조절을 통해 제어 가능한 음성 다양성을 제공하며, 동일한 텍스트에서 다양한 음성 생성이 가능하다.
- EFTS-Wav 포함한 모델 패밀리가 고품질과 효율성을 동시에 확보한 종합적 텍스트-웨이브폼 합성 아키텍처를 달성하여 아키텍처의 확장성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.