Skip to main content
QUICK REVIEW

[논문 리뷰] Attentron: Few-Shot Text-to-Speech Utilizing Attention-Based Variable-Length Embedding

Seungwoo Choi, Seungju Han|arXiv (Cornell University)|2020. 05. 18.
Speech Recognition and Synthesis참고 문헌 31인용 수 8
한 줄 요약

Attentron은 변수 길이 스타일 모델링을 위한 세밀한 주의 기반 인코더와 전반적인 안정성을 위한 개선된 인코더를 활용하는 이중 인코더 아키텍처를 통해, 몇 개의 참조 오디오 샘플만으로도 새로운 화자에 대한 클로닝을 수행하는 few-shot 텍스트-to-음성 모델을 제안한다. 이는 화자 유사도와 음성 품질 측면에서 현재 최고 수준의 성능을 달성하며, 특히 다수의 참조 입력을 사용할 경우 기존 방법들보다 객관적 평가와 인간 평가 모두에서 뛰어난 성능을 보인다.

ABSTRACT

On account of growing demands for personalization, the need for a so-called few-shot TTS system that clones speakers with only a few data is emerging. To address this issue, we propose Attentron, a few-shot TTS model that clones voices of speakers unseen during training. It introduces two special encoders, each serving different purposes. A fine-grained encoder extracts variable-length style information via an attention mechanism, and a coarse-grained encoder greatly stabilizes the speech synthesis, circumventing unintelligible gibberish even for synthesizing speech of unseen speakers. In addition, the model can scale out to an arbitrary number of reference audios to improve the quality of the synthesized speech. According to our experiments, including a human evaluation, the proposed model significantly outperforms state-of-the-art models when generating speech for unseen speakers in terms of speaker similarity and quality.

연구 동기 및 목표

  • 단지 몇 개의 참조 오디오 샘플만으로도 새로운 화자에 대해 텍스트-to-음성 시스템을 개인화하는 데 도전한다.
  • 단일 전역 화자 임베딩의 한계를 극복하여 세밀한 발화 스타일을 포착하지 못하고 짧은 참조 문장에서 성능이 저하되는 문제를 해결한다.
  • 피팅 조정이 필요 없으며, 다수의 참조 오디오 입력에 스케일링 가능한 few-shot TTS 시스템을 설계한다.
  • 불필요한 출력을 방지하기 위해 전반적인 안정성을 향상시키기 위해 개선된 길이의 인코더를 도입함으로써 합성 안정성과 품질을 향상시킨다.
  • 주의 메커니즘을 통해 변수 길이의 임베딩 학습을 가능하게 하여 다수의 참조로부터 시간적 스타일 정보를 유지한다.

제안 방법

  • 모델는 두 가지 유형의 임베딩에 조건이 되는 Tacotron 2 기반 TTS 프레임워크를 사용한다: 세밀한 인코더에서 유도된 변수 길이 임베딩과 개선된 인코더에서 유도된 전역 임베딩.
  • 세밀한 인코더는 다수의 참조 오디오 입력에서 관련 프레임을 추출하기 위해 스케일된 디트-프로덕트 주의를 적용하여 시간적 스타일 정보를 유지하는 변수 길이 임베딩을 생성한다.
  • 개선된 인코더는 참조 오디오의 시간적 특징을 집계하여 단일 전역 임베딩을 생성함으로써 합성 안정성을 향상시킨다.
  • 디코더는 텍스트 인코딩과 연결된 전역 임베딩에 주의를 기울이며, 세밀한 인코더의 임베딩은 브로드캐스트되어 자동회귀 스펙트로그램 생성을 조절하는 데 사용된다.
  • 모델는 엔드 투 엔드로 다중 화자 TTS 목표 함수에 따라 훈련되며, 추론 과정에서 임의의 수의 참조 샘플을 지원한다.
  • 제거 실험을 통해 각 구성 요소의 영향을 평가하며, 이는 개선된 인코더, 세밀한 인코더, 주의 메커니즘을 포함한다.

실험 결과

연구 질문

  • RQ1몇 개의 참조 오디오 샘플만으로 피팅 조정 없이도 새로운 화자를 클로닝할 수 있는 few-shot TTS 시스템은 가능한가?
  • RQ2고정 길이 전역 임베딩 대비 주의 기반 변수 길이 임베딩을 사용할 경우 화자 유사도와 음성 품질이 향상되는가?
  • RQ3개선된 길이의 인코더 추가가 합성 안정성과 이해 가능성에 어떤 영향을 미치는가?
  • RQ4다수의 참조 오디오 샘플은 성능 향상에 기여하는가, 그리고 더 많은 입력에 대해 효과적으로 확장 가능한가?
  • RQ5제안된 주의 메커니즘은 평균 풀링이나 자기 주의(self-attention)에 비해 새로운 화자에 대한 일반화 성능에서 어떻게 비교되는가?

주요 결과

  • Attentron은 훈련 및 추론 모두에서 8개의 참조 샘플을 사용할 경우, 새로운 화자에 대해 0.788의 화자 유사도와 11.67의 MCD를 기록하며, 기준 모델들보다 뚜렷이 뛰어난 성능을 보였다.
  • 훈련 시 8개의 참조 샘플, 추론 시 1개의 참조 샘플을 사용하는 Attentron(8-1)은 새로운 화자에 대해 0.769의 화자 유사도를 기록하여 단일 참조 기반 모델 대비 더 뛰어난 일반화 성능을 보였다.
  • 개선된 인코더를 제거할 경우 새로운 화자에 대해 143건의 주의 붕괴 이벤트가 발생하고 화자 유사도가 0.738로 떨어지며, 합성의 불안정성을 확인할 수 있었다.
  • 세밀한 인코더를 평균 풀링 또는 자기 주의로 대체할 경우, 새로운 화자 유사도는 각각 0.751과 0.755로 감소하였으며, 주의 기반 변수 길이 임베딩의 필요성을 입증하였다.
  • 주의 값에 컨볼루션 및 LSTM 레이어를 적용하여 주의 값을 수정한 'Encoded value' 변형 버전은 새로운 화자 유사도를 0.754로 낮추었으며, 원시 주의 특징을 조작할 경우 과적합 위험이 있음을 시사하였다.
  • Attentron(8-8)은 최고의 종합 성능을 기록하였으며, 훈련 및 추론 모두에서 다수의 참조를 사용함으로써 품질과 안정성을 극대화할 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.