Skip to main content
QUICK REVIEW

[논문 리뷰] Few Shot Adaptive Normalization Driven Multi-Speaker Speech Synthesis

Neeraj Kumar, Srishti Goel|arXiv (Cornell University)|2020. 12. 14.
Speech Recognition and Synthesis참고 문헌 5인용 수 5
한 줄 요약

이 논문은 단일 참조 오디오 샘플만으로도 미리 보지 않은 화자 스타일의 고품질 음성 생성이 가능한 소수 샘플 다중화자 음성 합성 모델인 FSM-SS를 제안한다. 정규화 레이어의 애자일 파라미터를 통해 발성 특성 요소인 음고, 에너지, 화자 신원을 분리함으로써, 비자율적 트랜스포머와 적응형 정규화를 활용하여 VCTK와 LibriTTS에서 최신 기술 수준의 성능을 달성한다. 특히, 새로운 화자에 대해 MCD가 9.78로 매우 낮게 유지되며, 강력한 음성 모핑 능력도 확보한다.

ABSTRACT

The style of the speech varies from person to person and every person exhibits his or her own style of speaking that is determined by the language, geography, culture and other factors. Style is best captured by prosody of a signal. High quality multi-speaker speech synthesis while considering prosody and in a few shot manner is an area of active research with many real-world applications. While multiple efforts have been made in this direction, it remains an interesting and challenging problem. In this paper, we present a novel few shot multi-speaker speech synthesis approach (FSM-SS) that leverages adaptive normalization architecture with a non-autoregressive multi-head attention model. Given an input text and a reference speech sample of an unseen person, FSM-SS can generate speech in that person's style in a few shot manner. Additionally, we demonstrate how the affine parameters of normalization help in capturing the prosodic features such as energy and fundamental frequency in a disentangled fashion and can be used to generate morphed speech output. We demonstrate the efficacy of our proposed architecture on multi-speaker VCTK and LibriTTS datasets, using multiple quantitative metrics that measure generated speech distortion and MoS, along with speaker embedding analysis of the generated speech vs the actual speech samples.

연구 동기 및 목표

  • 미리 보지 않은 화자에게도 고품질의 소수 샘플 다중화자 텍스트-음성 합성 기술을 적용할 수 있도록 도전 과제를 해결하기 위해.
  • 개인화된 출력을 위해 음성 생성 과정에서 음고, 에너지, 화자 신원 등의 발성 특징을 분리하고 제어하기 위해.
  • 화자별 맞춤 미세조정이나 광범위한 데이터가 필요 없이 0-샷 및 소수 샘플 적응을 가능하게 하기 위해.
  • 정규화 모듈에서 음고, 에너지, 화자 임베딩을 독립적으로 조작함으로써 음성 모핑의 가능성을 입증하기 위해.

제안 방법

  • 입력 텍스트와 참조 음성 샘플에 조건부로 작동하는 비자율적 피드포워드 트랜스포머 아키텍처를 사용하며, 적응형 정규화를 통합한다.
  • 적응형 정규화는 두 가지 변형으로 구현되며, 각각 컨볼루션 기반 및 멀티헤드 어텐션 기반으로, 모두 화자 임베딩, 참조 오디오의 음고 및 에너지에 조건부로 작동한다.
  • 인스턴스 정규화의 애자일 파라미터는 화자 임베딩, 기본 주파수(F0), 에너지에 의해 조절되어 발성 특성을 분리된 방식으로 제어한다.
  • 변동 예측기(Varience Predictor)를 통해 참조 음성의 발성 특징에 조건부로 지속시간, 에너지, F0를 예측한다.
  • 정규화 레이어는 트랜스포머 디코더에 통합되어 잔차 연결 이전의 은닉 표현을 조절한다.
  • 추론 시 화자 신원, F0, 에너지의 입력 임베딩을 독립적으로 변경함으로써 음성 모핑을 구현한다.

실험 결과

연구 질문

  • RQ1화자, 음고, 에너지 조건을 갖춘 적응형 정규화가 새로운 화자에 대해 고품질의 소수 샘플 다중화자 TTS를 가능하게 할 수 있는가?
  • RQ2정규화의 애자일 파라미터가 음고, 에너지, 화자 신원과 같은 발성 특성을 얼마나 효과적으로 분리하는가?
  • RQ3제안된 소수 샘플 접근 방식이 음성 품질과 발성 충실도 측면에서 0-샷 또는 기존 최신 기술 수준의 방법보다 뛰어나게 성능을 발휘하는가?
  • RQ4발성 입력을 조작함으로써 모델이 음성 모핑에 얼마나 효과적으로 활용될 수 있는가?

주요 결과

  • FSM-SS는 소수 샘플 설정에서 LibriTTS 데이터셋에서 MCD가 9.78로 기존 방법들(예: Skerry-Ryan et al., 2018)의 MCD 10.87보다 뚜렷이 떨어지지 않으며, 성능을 뛰어나게 한다.
  • 소수 샘플 설정에서 VCTK 데이터셋에서 GPE는 24.45로, VDE는 14.47로 감소하여 예측된 발성과 진짜 발성 간의 정렬이 향상됨을 나타낸다.
  • 제거 실험 결과, 정규화 모듈에 음고와 에너지를 통합함으로써 MCD는 21.68(기본 모델)에서 13.65로 감소하고, MoS는 2.64에서 3.72로 증가함을 확인하였다.
  • 컨볼루션 기반 정규화 변형이 멀티헤드 어텐션 기반 변형보다 성능이 뛰어나며, VCTK 및 LibriTTS 양쪽 데이터셋에서 더 낮은 MCD와 GPE를 기록하였다.
  • 질적 샘플을 통해 음고와 에너지를 독립적으로 조정함으로써 효과적인 음성 모핑이 가능함을 입증하였으며, F0와 에너지 수준을 변경한 사례에서 명백한 변화가 관찰되었다.
  • 화자 임베딩 분석 결과, 생성된 음성 임베딩이 참조 화자와 매우 유사하게 유지됨을 확인하여 정확한 스타일 전이가 이루어졌음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.