Skip to main content
QUICK REVIEW

[논문 리뷰] Parallel Tacotron: Non-Autoregressive and Controllable TTS

Isaac Elias, Heiga Zen|arXiv (Cornell University)|2020. 10. 22.
Speech Recognition and Synthesis참고 문헌 41인용 수 21
한 줄 요약

이 논문은 비자기적 텍스트-to-speech 모델인 Parallel Tacotron을 제안한다. 이 모델은 변동형 자동인코더 기반 잔차 인코더와 경량 컨볼루션을 사용하여 훈련과 추론을 매우 병렬적으로 처리할 수 있다. 자동인코딩 Tacotron 2의 자연스러움을 유지하면서도 최대 13배 빠른 속도를 달성했으며, 반복 스펙트로그램 손실과 VAE 지도 Prosody 모델링으로 성능 향상을 이룩했다.

ABSTRACT

Although neural end-to-end text-to-speech models can synthesize highly natural speech, there is still room for improvements to its efficiency and naturalness. This paper proposes a non-autoregressive neural text-to-speech model augmented with a variational autoencoder-based residual encoder. This model, called \emph{Parallel Tacotron}, is highly parallelizable during both training and inference, allowing efficient synthesis on modern parallel hardware. The use of the variational autoencoder relaxes the one-to-many mapping nature of the text-to-speech problem and improves naturalness. To further improve the naturalness, we use lightweight convolutions, which can efficiently capture local contexts, and introduce an iterative spectrogram loss inspired by iterative refinement. Experimental results show that Parallel Tacotron matches a strong autoregressive baseline in subjective evaluations with significantly decreased inference time.

연구 동기 및 목표

  • 현대 하드웨어에서 자동인코딩 TTS 모델의 훈련 및 추론 효율성 문제를 해결한다.
  • 자기적 복원 없이 Prosody와 맥락을 모델링하여 비자기적 TTS의 자연스러움을 향상시킨다.
  • 자기적 모델에서 교사 강제 학습으로 인해 발생하는 훈련과 추론 간 괴리감을 줄인다.
  • 변동형 자동인코더를 활용한 분리 잠재 표현을 통해 Prosody 제어가 가능한 음성 합성 구현을 가능하게 한다.
  • 감각적 품질을 희생시키지 않고 고속 추론을 달성하여 실시간 배포를 가능하게 한다.

제안 방법

  • 자기적 복원 없이도 효율적이고 병렬적인 추론이 가능한 자기주도 어텐션과 경량 컨볼루션(LConv)을 갖춘 비자기적 디코더를 제안한다.
  • 기본 스펙트로그램에서 잠재 Prosody 요소를 모델링하기 위해 변동형 자동인코더(VAE) 기반 잔차 인코더를 도입한다.
  • 화자 수준의 Prosody를 캡처하기 위한 글로벌 VAE와 프레임 수준의 Prosody 모델링을 위한 미세한 음소 수준 VAE를 각각 활용한다.
  • 반복 보정을 모방한 반복 스펙트로그램 손실을 도입하여 훈련 중 멜-스펙트로그램 품질을 향상시킨다.
  • 표준 자기주도 어텐션 대비 파rameter와 추론 시간을 줄이는 경량 컨볼루션(LConv)을 효율적인 대안으로 적용한다.
  • 지식 정렬 또는 직접 감독을 통해 예측된 지속 시간, F0, 에너지를 기반으로 비자기적 디코더를 조건화한다.

실험 결과

연구 질문

  • RQ1자기적 복원 없이도 비자기적 TTS 모델이 자동인코딩 Tacotron 2와 유사한 자연스러움을 달성할 수 있는가?
  • RQ2VAE 기반 잔차 인코더는 비자기적 TTS에서 Prosody 모델링과 자연스러움 향상에 얼마나 효과적인가?
  • RQ3반복 스펙트로그램 손실은 비자기적 멜-스펙트로그램 생성 품질을 향상시키는가?
  • RQ4경량 컨볼루션과 표준 자기주도 어텐션은 효율성과 감각적 품질 측면에서 어떻게 비교되는가?
  • RQ5비자기적 TTS 모델이 주관 평가에서 인간 수준의 자연스러움에 얼마나 가까이 다가설 수 있는가?

주요 결과

  • Parallel Tacotron은 주관 평가에서 Tacotron 2와 유사한 성능을 보였으며, 자연스러운 음성에 대한 MOS(4.40 vs. 4.54)와 선호도 점수(-0.01)로 인해 거의 구별되지 않는 품질을 확보했다.
  • 글로벌 VAE 도입으로 MOS는 4.33(비VAE)에서 4.40으로 향상되었고, 미세한 음소 수준 VAE 도입으로 추가로 4.42로 상승했으며, Tacotron 2 대비 선호도 점수는 +0.07을 기록했다.
  • 반복 스펙트로그램 손실은 감각적 품질에 소량이지만 측정 가능한 향상을 가져왔지만, 직접 비교에서는 통계적으로 유의미하지 않았다.
  • TPU에서 Tacotron 2 대비 13배 빠른 추론 속도를 기록했으며, LConv 기반 모델은 실시간 요소(RTF) 1013×를 달성해 트랜스포머 기반 모델을 크게 앞섰다.
  • 주관 평가에서 LConv 기반 자기주도 어텐션은 트랜스포머보다 선호도가 +0.05 높아, 품질과 효율성의 균형이 더 우수하다는 것을 시사했다.
  • 조작된 출력조차도, 미세한 VAE를 갖춘 Parallel Tacotron은 자연음성 대비 선호도 점수 -0.01을 기록해 인간 수준의 감각적 품질에 매우 가까운 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.