Skip to main content
QUICK REVIEW

[논문 리뷰] Parallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling

Isaac Elias, Heiga Zen|arXiv (Cornell University)|2021. 03. 26.
Speech Recognition and Synthesis참고 문헌 28인용 수 11
한 줄 요약

Parallel Tacotron 2는 자동회귀가 아닌 신경망 TTS 모델로, 감독된 지속 시간 신호 없이도 토큰-프레임 대응 관계와 지속 시간을 엔드 투 엔드로 학습한다. 이는 미분 가능한 지속 시간 모델과 보조 attention을 갖춘 학습된 업샘플링 메커니즘을 사용한다. 주관적 평가에서 최신 기준을 충족하며, Tacotron 2와 Parallel Tacotron를 모두 능가하는 자연스러움을 보이며, 말의 속도와 리듬을 제어 가능하게 한다.

ABSTRACT

This paper introduces Parallel Tacotron 2, a non-autoregressive neural text-to-speech model with a fully differentiable duration model which does not require supervised duration signals. The duration model is based on a novel attention mechanism and an iterative reconstruction loss based on Soft Dynamic Time Warping, this model can learn token-frame alignments as well as token durations automatically. Experimental results show that Parallel Tacotron 2 outperforms baselines in subjective naturalness in several diverse multi speaker evaluations. Its duration control capability is also demonstrated.

연구 동기 및 목표

  • 자동회귀 TTS 모델의 한계, 즉 느린 추론 속도와 과도 및 부족 생성 등의 복원력 문제를 해결한다.
  • 비자동회귀 TTS에서 외부 정렬기와 감독된 지속 시간 신호에 대한 의존도를 제거함으로써, 학습 복잡도를 증가시키고 모델의 복원력을 떨어뜨리는 문제를 해결한다.
  • 지속 시간 예측과 정렬 학습을 엔드 투 엔드로 미분 가능한 방식으로 학습시켜, 지속 시간 예측과 업샘플링을 거쳐 기울기 전파를 가능하게 한다.
  • 반복 네트워크를 제거하고 현대적 가속기에서 병렬 생성이 가능하게 함으로써 추론 속도와 효율성을 향상시킨다.
  • 학습 가능한, 미분 가능한 지속 시간 모델과 업샘플링을 통해 말의 리듬과 속도를 세밀하게 제어할 수 있도록 한다.

제안 방법

  • 연속적인 지속 시간을 예측하고, 반올림 연산을 통해 기울기 역전파가 가능한 완전히 미분 가능한 지속 시간 모델을 도입한다.
  • 진짜 지속 시간에 의존하지 않고, 보조적 맥락을 갖춘 새로운 attention 메커니즘을 사용해 토큰-프레임 대응 관계를 학습한다.
  • 예측된 지속 시간과 토큰 표현에서 파생된 맥락을 기반으로 한 도트 프로덕트 attention을 사용한 학습된 업샘플링 메커니즘을 사용한다.
  • 길이 일치 지도 없이도 예측된 Mel-spectrogram과 목표 Mel-spectrogram을 정렬하기 위해 소프트 동적 시간 왜곡(Soft-DTW) 기반의 반복 재구성 손실을 적용한다.
  • 길이 불일치 문제를 다루기 위해 티처 포싱을 Soft-DTW로 대체함으로써 학습 안정성과 정렬 정확도를 향상시킨다.
  • 지속 시간 모델과 업샘플링 메커니즘을 비자동회귀 TTS 프레임워크에 통합하여 병렬 생성과 더 빠른 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1감독된 지속 시간 신호나 외부 정렬기 없이도 비자동회귀 TTS 모델이 정확한 토큰-프레임 대응 관계와 지속 시간을 학습할 수 있는가?
  • RQ2기존 모델에서 비미분 가능한 반올림 방식과 비교해, 완전히 미분 가능한 지속 시간 예측 메커니즘이 정렬 품질과 모델 성능을 향상시키는가?
  • RQ3Soft-DTW 기반 재구성 손실이 길이 불일치 문제를 길이 일치 지도 없이 효과적으로 다룰 수 있는가?
  • RQ4학습된 지속 시간 조작을 통해 말의 속도와 리듬을 얼마나 잘 제어할 수 있는가?
  • RQ5제안된 아키텍처는 자동회귀 및 이전 비자동회귀 TTS 기준 모델보다 더 높은 자연스러움과 더 빠른 추론을 달성하는가?

주요 결과

  • Parallel Tacotron 2는 주관적 평가에서 MOS 4.40 ± 0.05를 기록했으며, Tacotron 2와 동일한 수준이지만 선호도 테스트에서는 0.19 ± 0.09의 점수로 승리했다.
  • 빠른 평가 세트에서 Parallel Tacotron 2는 Tacotron 2 대비 선호도 점수 0.69 ± 0.16을 기록해 훨씬 더 높은 자연스러움을 인식했다.
  • 보류 세트에서 Parallel Tacotron 2는 인간의 자연스러운 발화보다 더 높은 평가를 받았으며, 선호도 점수 0.01 ± 0.09를 기록해 인간 수준 또는 그 이상의 청각적 품질을 보였다.
  • 모델는 효과적인 지속 시간 제어를 보였다: 전반적인 속도 조절(0.75×에서 1.25×)과 단어 수준의 지속 시간 조절(0.5×에서 1.5×)이 일관되고 제어 가능한 음성 출력을 생성했다.
  • 주관적 평가 결과, 합성 음성의 억양이 기준 모델보다 훨씬 더 자연스럽다는 것이 확인되었으며, 특히 재구성 프롬프트를 사용한 빠른 세트에서 두드러졌다.
  • 반복 레이어를 제거하고 병렬 생성을 가능하게 함으로써 자동회귀 Tacotron 2보다 더 빠른 추론 속도를 달성했지만, 정확한 속도 메트릭은 보고되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.