Skip to main content
QUICK REVIEW

[논문 리뷰] NAUTILUS: a Versatile Voice Cloning System

Hieu-Thi Luong, Junichi Yamagishi|arXiv (Cornell University)|2020. 05. 22.
Speech Recognition and Synthesis참고 문헌 78인용 수 14
한 줄 요약

NAUTILUS는 단일 음성 클로닝 시스템으로, 다중 발화자 미리 훈련된 프레임워크를 활용하여 5분 분량의 비음성화된 음성만으로도 익히지 않은 음성을 클로닝하며, 음성 합성(TTS) 및 음성 변환(VC) 모드에서 최고 수준의 성능을 달성하고 높은 발화자 일致성을 유지한다. 이 시스템은 가용 데이터에 따라 클로닝 전략을 동적으로 조정하여 다양한 데이터 환경에서의 탄력적 적응을 가능하게 한다.

ABSTRACT

We introduce a novel speech synthesis system, called NAUTILUS, that can generate speech with a target voice either from a text input or a reference utterance of an arbitrary source speaker. By using a multi-speaker speech corpus to train all requisite encoders and decoders in the initial training stage, our system can clone unseen voices using untranscribed speech of target speakers on the basis of the backpropagation algorithm. Moreover, depending on the data circumstance of the target speaker, the cloning strategy can be adjusted to take advantage of additional data and modify the behaviors of text-to-speech (TTS) and/or voice conversion (VC) systems to accommodate the situation. We test the performance of the proposed framework by using deep convolution layers to model the encoders, decoders and WaveNet vocoder. Evaluations show that it achieves comparable quality with state-of-the-art TTS and VC systems when cloning with just five minutes of untranscribed speech. Moreover, it is demonstrated that the proposed framework has the ability to switch between TTS and VC with high speaker consistency, which will be useful for many applications.

연구 동기 및 목표

  • 텍스트에서 음성으로(TTS) 및 음성 변환(VC) 기능을 원활하게 통합하는 통합된 음성 클로닝 시스템을 개발하는 것.
  • 특히 익히지 않은 발화자로부터 5분 분량의 비음성화된 음성만으로도 고품질의 음성 클로닝을 가능하게 하는 것.
  • 다양한 데이터 조건(예: 레이블이 있는지 여부, 자료가 풍부한지 희소한지)에 맞춰 유연하게 적응할 수 있는 클로닝 전략을 설계하는 것.
  • TTS 및 VC 모드를 전환할 때도 높은 발화자 유사성과 자연스러움을 유지하는 것.
  • 학습 가능한 발화자 벡터와 공유 인코더를 사용하여 발화자 신원을 언어적 내용에서 분리하는 것.

제안 방법

  • TTS 및 VC 작업 모두에 대해 공유 인코더와 디코더를 훈련하기 위해 다중 발화자 음성 코퍼스를 활용한다.
  • 음성에 독립적인 음성 인코더를 사용하여 비음성화된 음성에서 발화자 임베딩을 추출함으로써 0-샷 음성 클로닝을 가능하게 한다.
  • 음소 시퀀스를 언어적 표현으로 매핑하기 위해 텍스트 인코더(지도 학습 또는 비지도 학습)를 적용하며, 피니튜닝을 통해 적응한다.
  • 웨이브넷 기반 신경 음성 합성기(WaveNet-based neural vocoder)를 사용하여 음향 특징에서 고해상도 웨이브폼을 생성한다.
  • 두 가지 클로닝 전략을 지원: 지도 학습(음성화된 데이터 사용) 및 비지도 학습(비음성화된 음성만 사용), 데이터 가용성에 따라 동적으로 전환한다.
  • 텍스트 및 음성 인코더 표현 간의 정렬을 비교하고 검증하기 위해 언어적 잠재 공간(LLE) 분석을 도입한다.

실험 결과

연구 질문

  • RQ1통합된 딥 러닝 프레임워크가 TTS 및 VC 모두에서 최고 수준의 성능을 달성하면서도 높은 발화자 일치성을 유지할 수 있는가?
  • RQ2음성화되지 않은 음성만으로 5분 분량의 음성을 사용해 음성 클로닝이 얼마나 효과적으로 이루어지는가?
  • RQ3지도 학습 및 비지도 학습 전략 간의 선택이 발음 정확성과 발화자 유사성에 어느 정도 영향을 미치는가?
  • RQ4다양한 발화자 조건 하에서 텍스트 인코더와 음성 인코더의 학습된 언어적 잠재 표현 간의 정렬 정도는 어떠한가?
  • RQ5시스템이 다양한 데이터 가용성 및 품질 조건에 맞춰 동적으로 동작을 조정하여 성능을 최적화할 수 있는가?

주요 결과

  • NAUTILUS는 단지 5분 분량의 비음성화된 음성만으로도 최고 수준의 음성 클로닝 성능을 달성하며, 전용 SOTA TTS 및 VC 시스템의 성능을 맞추거나 초월한다.
  • 비지도 클로닝 전략은 이미 자연스러운 발음과 잘 정렬되어 있는 영어 모국어 발화자(예: p294)에서는 지도 학습 전략을 능가한다.
  • 지도 학습 전략은 비모국어 발화자(예: MF6)의 경우 발음 품질을 저하시키지만 발화자 유사성을 향상시켜 제2외국어 발음에 효과적인 적응을 보여준다.
  • LLE 분석 결과, 모국어 발화자에서는 텍스트 및 음성 인코더 표현 간의 정렬이 잘 되어 있으나, 비모국어 발화자에서는 정렬 오류가 발생하며, 이는 지도 학습 전략이 이를 보완함을 확인한다.
  • 시스템은 TTS 및 VC 모드 간의 전환 시에도 일관된 발화자 신원을 유지하며 높은 탄력성과 강건성을 보여준다.
  • 용접 공정(welding step) 및 언어적 사이클 일致성 마진과 같은 보조 기법은 WER를 약간 향상시켜, 실사용 환경에서의 추가 최적화 여지를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.