Skip to main content
QUICK REVIEW

[논문 리뷰] Robust universal neural vocoding

Jaime Lorenzo-Trueba, Thomas Drugman|arXiv (Cornell University)|2018. 11. 15.
Speech Recognition and Synthesis참고 문헌 6인용 수 10
한 줄 요약

이 논문은 17개 언어에서 74명의 화자에 걸쳐 훈련된 강건한 유니버설 신경 음성합성기(네ural vocoder)를 제안하며, 도메인 내 및 도메인 외 조건에서 평균 MUSHRA 점수의 98%를 달성한다. 이는 순환 신경망 기반 아키텍처가 컨볼루션 신경망보다 특히 예측할 수 없는 화자, 스타일, 녹음 조건에서 훨씬 더 높은 안정성과 보편적인 강건성을 제공한다는 것을 보여준다.

ABSTRACT

This paper introduces a robust universal neural vocoder trained with 74 speakers (comprised of both genders) coming from 17 languages. This vocoder is shown to be capable of generating speech of consistently good quality (98% relative mean MUSHRA when compared to natural speech) regardless of whether the input spectrogram comes from a speaker, style or recording condition seen during training or from an out-of-domain scenario. Together with the system, we present a full text-to-speech analysis of robustness of a number of implemented systems. The complexity of systems tested range from a convolutional neural networks-based system conditioned on linguistics to a recurrent neural networks-based system conditioned on mel-spectrograms. The analysis shows that convolutional neural networks-based systems are prone to occasional instabilities, while the recurrent approaches are significantly more stable and capable of providing universalizing robustness.

연구 동기 및 목표

  • 다양한 화자, 언어, 녹음 조건에서 강건하게 일반화되는 유니버설 신경 음성합성기를 개발하기.
  • 도메인 내 및 도메인 외 시나리오에서 CNN 및 RNN 기반 시스템을 포함한 다양한 신경 음성합성기 아키텍처의 강건성 평가하기.
  • 실제 TTS 응용 프로그램에서의 안정성과 일반화를 향상시키는 아키텍처 선택 사항 규명하기.
  • 신경 음성합성에서 시스템 복잡성 대 비용 대비 강건성에 대한 종합적 분석 제공하기.

제안 방법

  • 17개 언어에서 성별과 다양한 발화 스타일을 포함한 총 74명의 화자로 구성된 다양한 데이터셋을 기반으로 신경 음성합성기 훈련하기.
  • 음성합성기의 입력 특징으로 멜스펙트로그램 사용하며, 언어적 및 음성적 특징에 따라 조건화된 모델 설계하기.
  • 비교를 위해 컨볼루션 신경망(CNN) 및 순환 신경망(RNN) 아키텍처 모두 구현하기.
  • 자연어 음성 대비 청각적 품질을 측정하기 위해 MUSHRA 점수를 사용해 모델 성능 평가하기.
  • 예측할 수 없는 화자, 스타일, 녹음 조건과 같은 도메인 외 입력에 대한 일반화 성능 테스트하기.
  • 체계적 아블레이션 및 교차 조건 평가를 통한 시스템 안정성과 강건성 분석하기.

실험 결과

연구 질문

  • RQ1신경 음성합성기의 성능은 도메인 내 및 도메인 외 화자, 스타일, 녹음 조건에서 어떻게 달라지나?
  • RQ2CNN 또는 RNN 중 어떤 신경 아키텍처가 유니버설 신경 음성합성에서 더 높은 안정성과 강건성을 보여주는가?
  • RQ3단일 음성합성기가 다양한 언어와 화자 특성에 얼마나 잘 일반화될 수 있는가?
  • RQ4모델 복잡성은 신경 음성합성에서 청각적 품질과 일반화에 어떤 영향을 미치는가?

주요 결과

  • 제안된 유니버설 음성합성기는 자연어 음성과 비교해 상대 평균 MUSHRA 점수 98%를 기록하며, 다양한 조건에서 높은 청각적 품질을 보여준다.
  • RNN 기반 음성합성기는 특히 도메인 외 시나리오에서 CNN 기반 대비 뚜렷한 안정성과 강건성을 보인다.
  • CNN 기반 시스템은 예측할 수 없는 화자나 스타일 변화에 대해 가끔 불안정성이 나타난다.
  • 시스템은 17개 언어와 남성·여성 화자 모두에서 일관된 성능을 유지하며 강력한 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.