Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Text-to-Speech System with Seq2Seq Model

Wang Gary|arXiv (Cornell University)|2019. 03. 11.
Speech Recognition and Synthesis참고 문헌 10인용 수 8
한 줄 요약

이 논문은 쿼리-키 어텐션과 가이드드 어텐션 매스크를 사용하여 학습을 가속화하고 어텐션 정렬을 향상시키는 경량 RNN 기반 엔드 투 엔드 텍스트투음성 시스템을 제안한다. 모델는 단 3시간 만에 인간 수준에 가까운 음성 품질(MOS 3.44)을 달성하며, Tacotron 2보다 3배 빠르고, Tacotron 2의 13M 대비 4.5M 파라미터만을 사용하여 음성 품질을 손상시키지 않은 채 상당한 효율성 향상을 보여준다.

ABSTRACT

Recent trends in neural network based text-to-speech/speech synthesis pipelines have employed recurrent Seq2seq architectures that can synthesize realistic sounding speech directly from text characters. These systems however have complex architectures and takes a substantial amount of time to train. We introduce several modifications to these Seq2seq architectures that allow for faster training time, and also allows us to reduce the complexity of the model architecture at the same time. We show that our proposed model can achieve attention alignment much faster than previous architectures and that good audio quality can be achieved with a model that's much smaller in size. Sample audio available at https://soundcloud.com/gary-wang-23/sets/tts-samples-for-cmpt-419.

연구 동기 및 목표

  • RNN 기반 텍스트투음성 시스템에서 학습 시간과 모델 복잡도를 줄이되 높은 음성 품질을 유지하는 것.
  • 가이드드 어텐션 매스크 기반 메커니즘을 통해 학습 중 어텐션 정렬을 가속화하는 것.
  • 디코딩 중 강제적 점진적 어텐션을 통해 추론의 견고성을 향상시키는 것.
  • 더 작은 모델이 Tacotron 2와 같은 더 큰 복잡한 베이스라인과 비교해 유사하거나 더 나은 성능을 낼 수 있음을 입증하는 것.
  • 제한된 컴퓨팅 환경에 적합한 더 효율적인 엔드 투 엔드 TTS 솔루션을 제공하는 것.

제안 방법

  • 기존의 위치에 민감한 애드티브 어텐션을 트랜스포머에서 영감을 얻은 스케일드 도트프로덕트 어텐션을 사용하는 쿼리-키 어텐션 메커니즘으로 대체한다.
  • 학습 중 어텐션 정렬의 잘못된 방향을 방지하기 위해 어텐션 정렬의 수렴 속도를 높이는 가이드드 어텐션 매스크를 도입한다.
  • 조기이고 안정적인 어텐션 정렬을 유도하기 위해 단조성 어텐션 손실을 적용하여 학습의 불안정성을 줄인다.
  • 입력 텍스트를 어텐션 계산을 위한 키 및 밸류 벡터로 임베딩하기 위해 이중 방향 LSTM/GRU 인코더를 사용한다.
  • 자기회귀적 생성을 위해 단일 방향 LSTM/GRU 디코더를 이중 레이어로 사용하며, 디코더 은닉 상태에서 파생된 어텐션 쿼리를 사용한다.
  • 주의가 문자를 건너뛰거나 멈추는 것을 방지하기 위해 추론 중 강제적 점진적 어텐션을 구현하여 일관된 음성 생성을 보장한다.

실험 결과

연구 질문

  • RQ1쿼리-키 어텐션 메커니즘이 RNN 기반 TTS 모델에서 학습 시간을 단축하고 어텐션 정렬을 향상시킬 수 있는가?
  • RQ2기본 어텐션과 비교해 가이드드 어텐션 매스크가 어텐션 정렬 수렴 속도를 크게 향상시키는가?
  • RQ3더 적은 파라미터를 가진 더 작은 모델이 Tacotron 2와 같은 더 큰 모델과 유사한 음성 품질을 달성할 수 있는가?
  • RQ4강제적 점진적 어텐션은 긴 시퀀스에 대해 추론의 안정성을 향상시키는 데 얼마나 효과적인가?
  • RQ5청각적 음성 품질을 손상시키지 않고 학습 시간을 얼마나 줄일 수 있는가?

주요 결과

  • 제안된 모델은 평균 의견 점수(MOS) 3.440 ± 0.182를 기록하여, 더 작은 아키텍처임에도 불구하고 Tacotron 2의 3.528 ± 0.179와 유사한 인간 수준의 음성 품질을 보여준다.
  • clair attention alignment에 도달하는 데 소요되는 학습 시간이 약 3시간으로, Tacotron 2의 추정치인 15시간보다 최소 3배 빠르게 단축되었다.
  • 모델은 단 450만 개의 파라미터만을 사용하여, Tacotron 2의 1300만 개 파라미터 대비 상당한 파라미터 효율성을 보여준다.
  • 가이드드 어텐션 매스크는 10,000번의 학습 스텝 후의 어텐션 플롯을 통해 더 빠르고 안정적인 어텐션 정렬을 가능하게 했다.
  • 추론 중 강제적 점진적 어텐션은 주의가 문자를 건너뛰거나 멈추는 것을 방지하여, 긴 문장에 대한 처리에서 견고성을 향상시켰다.
  • 학습 속도와 모델 크기 측면에서 여러 베이스라인을 뛰어넘었으며, 경쟁 가능한 청각적 품질을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.