Skip to main content
QUICK REVIEW

[논문 리뷰] Voice Imitating Text-to-Speech Neural Networks

Younggun Lee, Taesu Kim|arXiv (Cornell University)|2018. 06. 04.
Speech Recognition and Synthesis참고 문헌 11인용 수 3
한 줄 요약

이 논문은 번역문이나 추가 학습 없이 단 6초의 음성 샘플만으로도 새로운 화자 음성의 특성을 모방하는 신경망 텍스트-to-스피치(TTS) 모델을 제안한다. Tacotron에 스피커 임베딩 네트워크를 결합함으로써, 실시간으로 고품질의 스피커 특화 음성을 생성할 수 있으며, 이는 다중 스피커 TTS 모델 수준의 음성 품질을 달성하면서도 다양한 입력에 대해 즉각적인 음성 모방 기능을 제공한다.

ABSTRACT

We propose a neural text-to-speech (TTS) model that can imitate a new speaker's voice using only a small amount of speech sample. We demonstrate voice imitation using only a 6-seconds long speech sample without any other information such as transcripts. Our model also enables voice imitation instantly without additional training of the model. We implemented the voice imitating TTS model by combining a speaker embedder network with a state-of-the-art TTS model, Tacotron. The speaker embedder network takes a new speaker's speech sample and returns a speaker embedding. The speaker embedding with a target sentence are fed to Tacotron, and speech is generated with the new speaker's voice. We show that the speaker embeddings extracted by the speaker embedder network can represent the latent structure in different voices. The generated speech samples from our model have comparable voice quality to the ones from existing multi-speaker TTS models.

연구 동기 및 목표

  • 번역문이나 추가 학습 없이 단 6초의 음성 샘플만으로도 새로운 화자 음성을 즉각적으로 모방할 수 있도록 하는 것.
  • 단일 짧은 음성 클립을 사용하여 목표 화자의 음성 특성을 가진 자연스러운 음성을 생성할 수 있는 신경망 TTS 시스템을 개발하는 것.
  • 스피커 임베딩 추출의 유연성을 탐색하기 위해 스피커 임베더가 음성 이외의 다양한 입력 모odalities를 처리할 수 있도록 하는 것.
  • 기존의 다중 스피커 TTS 모델과 비교하여 생성된 음성의 청각적 품질과 스피커 식별 가능성의 평가를 수행하는 것.

제안 방법

  • 새로운 화자에 대한 짧은 음성 클립에서 압축된 스피커 임베딩을 추출하도록 스피커 임베더 네트워크를 학습한다.
  • 스피커 임베딩을 텍스트 입력과 결합하여 수정된 Tacotron 모델에 입력함으로써, 텍스트와 화자의 음성에 조건화된 음성을 생성한다.
  • 스피커 임베더와 함께 TTS 모델을 엔드 투 엔드로 미세조정하여 음성 클로닝과 음성 생성의 공동 최적화를 가능하게 한다.
  • 주성분 분석(PCA)을 사용하여 학습된 스피커 임베딩의 잠재적 구조를 시각화하고, 음성 특성을 얼마나 잘 포착하는지 평가한다.
  • 아마존 Mechanical Turk를 통해 인력 투입 설문 조사를 실시하여, 제안된 모델과 기준 다중 스피커 TTS 모델 간의 음성 품질과 스피커 식별 가능성의 정량적 비교를 수행한다.
  • 스피커 임베더는 다양한 입력 소스로 일반화될 수 있도록 설계되어, 감정 인식 기반 음성 합성에 확장 가능하게 하기 위해 영상과 같은 다중모달 입력에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1번역문이나 추가 학습 없이 단 6초의 음성 샘플만으로도 신규 화자의 음성을 모방할 수 있는가?
  • RQ2제안된 음성 모방 TTS의 음성 품질은 표준 다중 스피커 TTS 모델과 비교하여 어떻게 되는가?
  • RQ3최소한의 데이터로 학습된 경우에도 생성된 음성이 얼마나 잘 특정 스피커의 정체성을 유지하는가?
  • RQ4스피커 임베더 네트워크는 영상과 같은 다른 입력 모달리티로 일반화될 수 있는가? 이를 통해 다중모달 음성 합성 기능을 제공할 수 있는가?

주요 결과

  • 제안된 음성 모방 TTS 모델은 인력 투입 설문 조사에서 평균 점수 -0.10 ± 1.16을 기록하여, 다중 스피커 TTS 기준 모델과 비교해 유의미한 청각적 차이가 없음을 나타낸다.
  • 음성 모방 TTS의 스피커 식별 정확도는 60.1%로, 50%의 무작위 기준보다 유의미하게 높아, 생성된 음성이 식별 가능한 스피커 특성을 유지하고 있음을 입증한다.
  • 다중 스피커 TTS 모델은 70.5%의 더 높은 스피커 식별 정확도를 기록하여, 더 큰 다양성 있는 데이터셋으로 학습한 결과의 우수성을 반영하고 있다.
  • PCA 시각화를 통해 스피커 임베더 네트워크가 추출한 스피커 임베딩은 다양한 음성의 잠재적 구조를 효과적으로 표현하고 있음을 확인하였다.
  • 모델은 재학습 없이도 즉각적인 음성 모방이 가능하므로, 최소한의 입력으로도 실시간 응용에 적합하다.
  • 이 방법은 얼굴 영상과 같은 다중모달 입력으로도 확장 가능하여, 감정 및 맥락 인식 기반의 텍스트-to-스피치 합성에 잠재적 응용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.