Skip to main content
QUICK REVIEW

[논문 리뷰] Bootstrapping non-parallel voice conversion from speaker-adaptive text-to-speech

Hieu-Thi Luong, Junichi Yamagishi|arXiv (Cornell University)|2019. 09. 14.
Speech Recognition and Synthesis참고 문헌 39인용 수 7
한 줄 요약

이 논문은 사전에 트레이닝된 화자 적응형 텍스트-to-스피치(TTS) 모델을 활용하여 비병렬 음성 변환(VC) 시스템을 부트스트랩하는 새로운 프레임워크를 제안한다. 이로 인해 최소한의 대상 화자 데이터로도 저자원 VC를 구현할 수 있으며, 백프로파게이션 기반 적응을 통해 음성 전사 없이도 성능을 확보한다. 이 방법은 문맥 내 VC에서 경쟁적인 성능을 달성하며, 비동일 언어 간 VC 및 비동일 언어 화자 적응 가능성도 입증한다. 심지어 미리보지 않은 언어에 대해서도 가능하다.

ABSTRACT

Voice conversion (VC) and text-to-speech (TTS) are two tasks that share a similar objective, generating speech with a target voice. However, they are usually developed independently under vastly different frameworks. In this paper, we propose a methodology to bootstrap a VC system from a pretrained speaker-adaptive TTS model and unify the techniques as well as the interpretations of these two tasks. Moreover by offloading the heavy data demand to the training stage of the TTS model, our VC system can be built using a small amount of target speaker speech data. It also opens up the possibility of using speech in a foreign unseen language to build the system. Our subjective evaluations show that the proposed framework is able to not only achieve competitive performance in the standard intra-language scenario but also adapt and convert using speech utterances in an unseen language.

연구 동기 및 목표

  • 화자 적응형 TTS를 활용하여 VC와 TTS를 공통 프레임워크로 통합함으로써 VC 부트스트랩을 실현한다.
  • VC에 대한 데이터 의존도를 줄이기 위해, TTS 사전학습 단계에서의 높은 데이터 요구량을 이행함으로써, 대상 화자 음성 데이터를 최소한으로 사용할 수 있도록 한다.
  • 대상 화자에 대한 비전사된 외국어 발화를 활용하여, 저자원 또는 알려지지 않은 언어에서도 VC를 가능하게 한다.
  • 교차 언어 시나리오에서의 성능 평가를 위해, 교차 언어 화자 적응 및 언어 간 음성 변환을 포함한다.

제안 방법

  • 음성 전사 없이 백프로파게이션을 통해 트레이닝된 화자 적응형 TTS 모델을 활용하여, 화자에 영향을 받지 않는 음성 언어 임베딩(LLE)을 추출한다.
  • 대상 화자 발화를 사용하여 엔드 투 엔드 백프로파게이션을 통해 액oustic 모델을 파인튜닝함으로써, TTS 모델의 화자 적응 능력을 VC 시스템에 이관한다.
  • 언어적 내용과 화자 신원을 분리하기 위해, 화자 특성과 언어적 내용을 분리하는 잠재 변수(LLE)를 사용한다.
  • 비병렬 설정을 통해, 병렬 학습 데이터가 필요 없이도, 적응된 TTS 모델을 통해 소스 화자 특징을 대상 화자 특징으로 매핑함으로써 VC 시스템을 학습한다.
  • 외국어 발화를 대상 화자에 적응시키는 방식으로, 동일한 프레임워크를 교차 언어 시나리오에 적용함으로써, 자원이 없는 환경에서의 적응 작업으로 간주한다.
  • 음성 변환 중에 말하기 속도와 언어적 내용을 유지하기 위해 시퀀스-투-시퀀스 아키텍처를 사용하며, 자연스러운 유창성을 확보한다.

실험 결과

연구 질문

  • RQ1화자 적응형 TTS 모델을 활용하여 비병렬 VC 시스템을 효과적으로 부트스트랩할 수 있으며, 데이터 의존도를 줄일 수 있는가?
  • RQ2비전사된, 알려지지 않은 언어의 음성 자료를 사용할 때, 제안된 프레임워크의 교차 언어 VC 성능은 어떠한가?
  • RQ3저자원 언어 환경에서 시스템이 경쟁적인 화자 유사도와 음성 품질을 달성할 수 있는가?
  • RQ4교차 언어 화자 적응이 성능에 악영향을 미치며, 청취자에게 만족스러운 결과를 제공할 수 있는가?

주요 결과

  • 제안된 프레임워크는 표준 문맥 내 VC에서 경쟁적인 성능을 달성하였으며, VCC2018 벤치마크에서 음성 품질 3위, 화자 유사도 6위를 기록하였다.
  • 주관적 평가 결과, 동성별 및 이성별 화자 쌍 모두에서 일관된 성능을 보이며, 뛰어난 내성성을 입증하였다.
  • 저자원 언어 환경에서 교차 언어 화자 적응(EJ-E)을 성공적으로 수행하였지만, 문맥 내 영어(EE-E)에 비해 점수는 낮아졌으며, 측정 가능한 성능 저하이지만 수용 가능한 수준임을 시사한다.
  • 저자원 언어 시나리오(EE-J 및 EJ-J)에서 언어 간 변환 가능성을 입증하였으며, EJ-J가 EE-J보다 더 높은 성능을 보이며 일부 교차 언어 전이가 가능함을 시사한다.
  • 유사도 평가 결과, 동일한 双어 화자에 의해 말해진 자연스러운 영어 발화(NA-E)는 자연스러운 일본어 발화(NA-J)보다 유의미하게 낮게 평가되었다. 이는 교차 언어 유사도 인식에 어려움이 있음을 시사한다.
  • 향후 저자원 및 다국어 VC 연구를 위한 강력한 베이스라인을 확립하였으며, 향후 다국어 데이터가 추가로 확보될 경우 더욱 유망한 전망을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.