[논문 리뷰] AlignTTS: Efficient Feed-Forward Text-to-Speech System without Explicit Alignment
AlignTTS는 자동회귀적 교사 모델에 의존하지 않고도 최신 기술 수준의 성능을 달성하는 비자기회적, 피드포워드 기반 트랜스포머 기반 음성합성 시스템을 제안한다. 바움-웰치 알고리즘에 영감을 얻은 새로운 정렬 손실을 도입함으로써 학습 중에 정확한 텍스트-멜스펙트럼 정렬을 학습하게 되어, 실시간보다 50배 이상 빠른 병렬 추론이 가능해지며, 이로 인해 MOS가 0.03 향상된다.
Targeting at both high efficiency and performance, we propose AlignTTS to predict the mel-spectrum in parallel. AlignTTS is based on a Feed-Forward Transformer which generates mel-spectrum from a sequence of characters, and the duration of each character is determined by a duration predictor.Instead of adopting the attention mechanism in Transformer TTS to align text to mel-spectrum, the alignment loss is presented to consider all possible alignments in training by use of dynamic programming. Experiments on the LJSpeech dataset show that our model achieves not only state-of-the-art performance which outperforms Transformer TTS by 0.03 in mean option score (MOS), but also a high efficiency which is more than 50 times faster than real-time.
연구 동기 및 목표
- 자기회귀적 교사 모델에 의존하지 않는 고효율 비자기회적 음성합성 시스템을 개발하는 것.
- 명시적인 어텐션 메커니즘 없이도 텍스트와 멜스펙트럼 간의 정렬 학습을 향상시키는 것.
- 실시간 추론 속도를 확보하면서도 최신 기술 수준의 음성 품질을 달성하는 것.
- 모든 가능한 정렬을 고려하는 훈련 목표를 설계하여 정확성과 견고성을 향상시키는 것.
제안 방법
- 모델는 피드포워드 트랜스포머(FFT)를 사용하며, 스택된 FFT 블록, 자기어텐션, 1차원 컨볼루션을 통해 병렬로 멜스펙트럼을 생성한다.
- 지속 시간 예측기( duration predictor)는 각 문자의 발음 지속 시간을 추정하며, 이는 추론 중에 텍스트와 멜스펙트럼을 정렬하는 데 사용되는 길이 조절기(length regulator)에 의해 활용된다.
- 바움-웰치 알고리즘에 영감을 얻은 정렬 손실이 도입되어, 역전파 동안 모든 가능한 정렬을 고려하여 모델을 훈련시킨다.
- 혼합 밀도 네트워크를 사용하여 텍스트에 조건부로 멜스펙트럼의 분포를 모델링함으로써 정렬 학습을 향상시킨다.
- 재구성 손실, 지속 시간 손실, 정렬 손실의 조합을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
- 예측된 멜스펙트럼에서 웨이브폼을 합성하기 위해 병렬 신경 음원인 WaveGlow를 사용한다.
실험 결과
연구 질문
- RQ1비자기회적 TTS 시스템이 자동회귀적 사전 훈련 모델을 사용하지 않고도 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ2모든 가능한 정렬을 고려하는 미분 가능한 정렬 손실이 정렬 정확도와 합성 품질을 향상시킬 수 있는가?
- RQ3피드포워드 트랜스포머 아키텍처가 고속 추론을 가능하게 하면서도 높은 음성 품질을 유지할 수 있는가?
- RQ4제안된 정렬 손실이 어텐션 기반 정렬과 비교해 정밀도와 견고성 측면에서 어떻게 성능을 내는가?
주요 결과
- AlignTTS는 LJSpeech 데이터셋에서 평균 의견 점수(MOS) 4.05±0.12를 기록하여, Transformer TTS보다 MOS가 0.03 높다.
- 모델은 약 10초의 음성을 0.18초 내로 합성하여 실시간 대비 50배 이상의 속도 향상을 달성한다.
- 정렬 손실은 그림 3에서 시각적으로 확인한 바와 같이, Transformer TTS의 어텐션 메커니즘보다 텍스트와 멜스펙트럼 간의 정렬을 더 정밀하게 구현한다.
- AlignTTS의 추론 속도는 10초 분량의 음성에 대해 0.18초이며, TTS 모델에선 0.06초, WaveGlow 음원기에는 0.12초가 소요된다.
- Tacotron2(4.58초)와 Transformer TTS(3.26초)와 같은 자기회귀 모델보다는 훨씬 빠른 속도를 확보하면서도 더 높은 품질을 유지한다.
- 지속 시간 예측기와 길이 조절기는 음성 속도와 휴지 시간 제어를 가능하게 하여 추론 중에 운율 제어가 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.