Skip to main content
QUICK REVIEW

[논문 리뷰] Non-Parallel Voice Conversion with Cyclic Variational Autoencoder

Patrick Lumban Tobing, Yi-Chiao Wu|arXiv (Cornell University)|2019. 07. 24.
Speech Recognition and Synthesis참고 문헌 35인용 수 13
한 줄 요약

이 논문은 스펙트럼의 순환 일致성 흐름을 도입함으로써 VAE 기반 음성 변환의 성능을 향상시키는 CycleVAE 기반 비쌍체 음성 변환 프레임워크를 제안한다: 변환된 스펙트럼을 다시 모델에 피드백하여 최적화 가능한 순환 재구성 결과를 생성한다. 이 방법은 더 높은 스펙트럼 정확도, 향상된 잠재 특징 상관관계, 그리고 특히 도전적인 성별 간 변환 환경에서 뚜렷한 향상된 음성 품질과 변환 정확도를 달성한다.

ABSTRACT

In this paper, we present a novel technique for a non-parallel voice conversion (VC) with the use of cyclic variational autoencoder (CycleVAE)-based spectral modeling. In a variational autoencoder(VAE) framework, a latent space, usually with a Gaussian prior, is used to encode a set of input features. In a VAE-based VC, the encoded latent features are fed into a decoder, along with speaker-coding features, to generate estimated spectra with either the original speaker identity (reconstructed) or another speaker identity (converted). Due to the non-parallel modeling condition, the converted spectra can not be directly optimized, which heavily degrades the performance of a VAE-based VC. In this work, to overcome this problem, we propose to use CycleVAE-based spectral model that indirectly optimizes the conversion flow by recycling the converted features back into the system to obtain corresponding cyclic reconstructed spectra that can be directly optimized. The cyclic flow can be continued by using the cyclic reconstructed features as input for the next cycle. The experimental results demonstrate the effectiveness of the proposed CycleVAE-based VC, which yields higher accuracy of converted spectra, generates latent features with higher correlation degree, and significantly improves the quality and conversion accuracy of the converted speech.

연구 동기 및 목표

  • 변환된 스펙트럼에 대한 직접 최적화가 부족한 탓에 비쌍체 음성 변환에서 성능 저하 문제를 해결하기 위해.
  • 기존 VAE 기반 VC는 재구성된 스펙트럼만 최적화하고 변환된 스펙트럼은 최적화하지 않는 한계를 극복하기 위해.
  • 잠재 공간 내에서 화자 신원과 자음음소 정보의 분리도를 향상시켜 변환 정확도를 높이기 위해.
  • 원천 및 대상 화자 간의 상이성이 높은 경우, 예를 들어 성별 간 변환과 같이 어려운 상황에서도 견고한 음성 변환을 가능하게 하기 위해.
  • 제한된 쌍체 데이터를 가진 실생활 응용에 적합한 데이터 기반 비쌍체 음성 변환 프레임워크 개발하기 위해.

제안 방법

  • 변환된 스펙트럼을 다시 모델에 피드백하여 순환 일치 흐름을 도입하는 CycleVAE 기반 아키텍처를 제안한다.
  • 재사용된 변환된 특징을 입력으로 사용해 순환 재구성 스펙트럼을 생성하며, 이는 훈련 중에 직접 최적화된다.
  • 순환 재구성에 대한 재구성 손실과 잠재 공간에 대한 정규화를 함께 사용해 모델을 훈련시킨다.
  • 잠재 코드와 화자 코드 특징을 통합하여 재구성된(원본 화자) 및 변환된(대상 화자) 스펙트럼을 생성한다.
  • 순환 재구성 결과를 다음 순환의 입력으로 사용해 반복적 순환을 가능하게 하여 매핑 흐름의 일관성을 강화한다.
  • 공유된 자음음소 특성들을 모델링하기 위해 가우시안 사전 분포를 갖는 변동형 오토인코더의 잠재 공간을 활용한다.

실험 결과

연구 질문

  • RQ1순환 일관성 피드백은 비쌍체 음성 변환에서 변환된 스펙트럼의 최적화를 향상시킬 수 있는가?
  • RQ2CycleVAE 프레임워크는 서로 다른 화자 간의 잠재 특징 상관관계를 향상시켜 자음음소 정보의 분리도가 향상되었음을 시사하는가?
  • RQ3성별 간 변환과 같이 화자 간 차이가 가장 두드러지는 상황에서 제안된 방법은 어떻게 성능을 내는가?
  • RQ4순환 재구성 손실은 기존 VAE 기반 VC에 비해 더 높은 스펙트럼 정확도와 향상된 음성 품질을 이끌 수 있는가?
  • RQ5순환 일관성 흐름은 비쌍체 음성 변환에서 쌍체 훈련 데이터 의존도를 어느 정도 감소시킬 수 있는가?

주요 결과

  • 제안된 CycleVAE 기반 VC는 선호도 테스트에서 뚜렷한 더 높은 청취자 선호도를 보였으며, 59.17%의 청취자가 기존 VAE보다 CycleVAE 출력을 선호했고, p = 6.01e-05로 통계적으로 유의미했다.
  • 성별 간 변환에서는 CycleVAE가 기존 VAE를 압도했으며, 70.83%가 CycleVAE를 선호하고 29.17%가 VAE를 선호했고, p = 1.18e-10으로 매우 유의미한 성능 향상을 보였다.
  • 모든 범주에서 화자 유사도 인식도 향상되었으며, 61.00%의 청취자가 CycleVAE 출력을 VAE의 39.00%보다 선호했고, p = 1.11e-05로 유의미했다.
  • 코사인 유사도 분석 결과, CycleVAE는 원본 화자와 대상 화자 간의 잠재 특징 유사도를 더 높게 생성하여 자음음소 공간 내에서 더 나은 정렬을 나타냈다.
  • 객관적 지표는 더 높은 스펙트럼 정확도와 향상된 잠재 공간 분리도를 확인했으며, 특히 거리가 먼 화자 쌍에 유리했다.
  • 순환 재구성 메커니즘이 성공적으로 변환 흐름의 간접 최적화를 가능하게 하여 비쌍체 훈련의 핵심 한계를 극복했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.