Skip to main content
QUICK REVIEW

[논문 리뷰] AlignTTS: Efficient Feed-Forward Text-to-Speech System without Explicit Alignment

Zhen Zeng, Jianzong Wang|arXiv (Cornell University)|2020. 03. 04.
Speech Recognition and Synthesis참고 문헌 27인용 수 4
한 줄 요약

AlignTTS는 자동회귀적 교사 모델에 의존하지 않고도 최신 기술 수준의 성능을 달성하는 비자기회적, 피드포워드 기반 트랜스포머 기반 음성합성 시스템을 제안한다. 바움-웰치 알고리즘에 영감을 얻은 새로운 정렬 손실을 도입함으로써 학습 중에 정확한 텍스트-멜스펙트럼 정렬을 학습하게 되어, 실시간보다 50배 이상 빠른 병렬 추론이 가능해지며, 이로 인해 MOS가 0.03 향상된다.

ABSTRACT

Targeting at both high efficiency and performance, we propose AlignTTS to predict the mel-spectrum in parallel. AlignTTS is based on a Feed-Forward Transformer which generates mel-spectrum from a sequence of characters, and the duration of each character is determined by a duration predictor.Instead of adopting the attention mechanism in Transformer TTS to align text to mel-spectrum, the alignment loss is presented to consider all possible alignments in training by use of dynamic programming. Experiments on the LJSpeech dataset show that our model achieves not only state-of-the-art performance which outperforms Transformer TTS by 0.03 in mean option score (MOS), but also a high efficiency which is more than 50 times faster than real-time.

연구 동기 및 목표

  • 자기회귀적 교사 모델에 의존하지 않는 고효율 비자기회적 음성합성 시스템을 개발하는 것.
  • 명시적인 어텐션 메커니즘 없이도 텍스트와 멜스펙트럼 간의 정렬 학습을 향상시키는 것.
  • 실시간 추론 속도를 확보하면서도 최신 기술 수준의 음성 품질을 달성하는 것.
  • 모든 가능한 정렬을 고려하는 훈련 목표를 설계하여 정확성과 견고성을 향상시키는 것.

제안 방법

  • 모델는 피드포워드 트랜스포머(FFT)를 사용하며, 스택된 FFT 블록, 자기어텐션, 1차원 컨볼루션을 통해 병렬로 멜스펙트럼을 생성한다.
  • 지속 시간 예측기( duration predictor)는 각 문자의 발음 지속 시간을 추정하며, 이는 추론 중에 텍스트와 멜스펙트럼을 정렬하는 데 사용되는 길이 조절기(length regulator)에 의해 활용된다.
  • 바움-웰치 알고리즘에 영감을 얻은 정렬 손실이 도입되어, 역전파 동안 모든 가능한 정렬을 고려하여 모델을 훈련시킨다.
  • 혼합 밀도 네트워크를 사용하여 텍스트에 조건부로 멜스펙트럼의 분포를 모델링함으로써 정렬 학습을 향상시킨다.
  • 재구성 손실, 지속 시간 손실, 정렬 손실의 조합을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 예측된 멜스펙트럼에서 웨이브폼을 합성하기 위해 병렬 신경 음원인 WaveGlow를 사용한다.

실험 결과

연구 질문

  • RQ1비자기회적 TTS 시스템이 자동회귀적 사전 훈련 모델을 사용하지 않고도 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2모든 가능한 정렬을 고려하는 미분 가능한 정렬 손실이 정렬 정확도와 합성 품질을 향상시킬 수 있는가?
  • RQ3피드포워드 트랜스포머 아키텍처가 고속 추론을 가능하게 하면서도 높은 음성 품질을 유지할 수 있는가?
  • RQ4제안된 정렬 손실이 어텐션 기반 정렬과 비교해 정밀도와 견고성 측면에서 어떻게 성능을 내는가?

주요 결과

  • AlignTTS는 LJSpeech 데이터셋에서 평균 의견 점수(MOS) 4.05±0.12를 기록하여, Transformer TTS보다 MOS가 0.03 높다.
  • 모델은 약 10초의 음성을 0.18초 내로 합성하여 실시간 대비 50배 이상의 속도 향상을 달성한다.
  • 정렬 손실은 그림 3에서 시각적으로 확인한 바와 같이, Transformer TTS의 어텐션 메커니즘보다 텍스트와 멜스펙트럼 간의 정렬을 더 정밀하게 구현한다.
  • AlignTTS의 추론 속도는 10초 분량의 음성에 대해 0.18초이며, TTS 모델에선 0.06초, WaveGlow 음원기에는 0.12초가 소요된다.
  • Tacotron2(4.58초)와 Transformer TTS(3.26초)와 같은 자기회귀 모델보다는 훨씬 빠른 속도를 확보하면서도 더 높은 품질을 유지한다.
  • 지속 시간 예측기와 길이 조절기는 음성 속도와 휴지 시간 제어를 가능하게 하여 추론 중에 운율 제어가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.