Skip to main content
QUICK REVIEW

[논문 리뷰] Daft-Exprt: Robust Prosody Transfer Across Speakers for Expressive Speech Synthesis.

Julian Zaïdi, Hugo Seuté|arXiv (Cornell University)|2021. 08. 04.
Speech Recognition and Synthesis참고 문헌 29인용 수 5
한 줄 요약

Daft-Exprt는 FiLM 조절과 적대적 훈련을 사용하여 말하는 이의 음성 톤을 분리함으로써 다양한 화자 간 음성 톤 전달을 향상시키는 다중 화자 음성 모델이다. 자연스러운 음성 품질을 유지하면서도 화자 간 및 텍스트 간 음성 톤 전달에서 최고 성능을 달성하였으며, 공개된 코드와 샘플이 제공된다.

ABSTRACT

This paper presents Daft-Exprt, a multi-speaker acoustic model advancing the state-of-the-art on inter-speaker and inter-text prosody transfer. This improvement is achieved using FiLM conditioning layers, alongside adversarial training that encourages disentanglement between prosodic information and speaker identity. The acoustic model inherits attractive qualities from FastSpeech 2, such as fast inference and local prosody attributes prediction for finer grained control over generation. Experimental results show that Daft-Exprt significantly outperforms strong baselines on prosody transfer tasks, while yielding naturalness comparable to state-of-the-art expressive models. Moreover, results indicate that adversarial training effectively discards speaker identity information from the prosody representation, which ensures Daft-Exprt will consistently generate speech with the desired voice. We publicly release our code and provide speech samples from our experiments.

연구 동기 및 목표

  • 표현적 음성 합성에서 화자 간 음성 톤 전달을 향상시키면서도 화자 정체성을 유지하기 위해.
  • 적대적 훈련을 통해 음성 톤 정보를 화자 정체성에서 분리하기 위해.
  • FastSpeech 2를 영감으로 삼아 빠른 추론과 세밀한 음성 톤 제어를 유지하기 위해.
  • 최고 수준의 표현적 모델과 비교해 자연스러운 음성 품질을 달성하기 위해.
  • 음성 표현에서 화자 정체성을 제거함으로써 일관된 음성 생성을 가능하게 하기 위해.

제안 방법

  • 음성 조절 벡터에 기반해 음성 모델을 조절하기 위해 FiLM 조절 레이어를 사용한다.
  • 모델이 음성 표현에서 화자 정체성을 제거하도록 유도하기 위해 적대적 훈련을 시행한다.
  • 빠른 추론과 국소 음성 톤 예측을 위해 FastSpeech 2의 아키텍처를 적응한다.
  • 진짜와 생성된 음성 표현을 구분할 수 있는 판별기 모델을 훈련시켜 분리 효과를 증진시킨다.
  • 공통 음성 모델링과 화자별 조절을 위한 설정을 사용한 다중 화자 환경을 적용한다.
  • 재구성, 적대적, 지속 시간 예측 손실 성분을 포함한 엔드 투 엔드 훈련을 통합한다.

실험 결과

연구 질문

  • RQ1FiLM 조절이 표현적 음성 합성에서 다양한 화자 간 음성 톤 전달에 기여하는가?
  • RQ2적대적 훈련이 잠재 표현에서 음성 톤 콘텐츠를 화자 정체성에서 효과적으로 분리하는가?
  • RQ3우수한 음성 톤 전달 성능를 달성하면서도 자연스러운 음성 품질을 유지할 수 있는가?
  • RQ4전달된 음성 톤을 사용해 음성을 생성할 때 모델이 화자 정체성을 어느 정도 유지하는가?
  • RQ5모델은 화자 간 및 텍스트 간 음성 톤 전달 과제에서 강력한 베이스라인과 비교해 어떻게 성능을 냈는가?

주요 결과

  • Daft-Exprt는 화자 간 및 텍스트 간 음성 톤 전달 과제에서 강력한 베이스라인을 크게 앞서간다.
  • 적대적 훈련은 화자 정체성을 음성 표현에서 성공적으로 제거하여 일관된 음성 생성을 보장한다.
  • 최고 수준의 표현적 음성 합성 모델과 비교해 자연스러운 음성 품질을 달성한다.
  • FiLM 조절은 음성 생성 중 음성 톤 속성에 대한 세밀한 제어를 가능하게 한다.
  • FastSpeech 2를 영감으로 삼은 아키텍처 덕분에 빠른 추론 속도를 유지한다.
  • 코드와 음성 샘플의 공개로 재현 가능성과 향후 연구가 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.