Skip to main content
QUICK REVIEW

[논문 리뷰] Investigation of Using Disentangled and Interpretable Representations for One-shot Cross-lingual Voice Conversion

Seyed Hamidreza Mohammadi, Tae-Hwan Kim|arXiv (Cornell University)|2018. 08. 15.
Speech Recognition and Synthesis참고 문헌 24인용 수 7
한 줄 요약

이 논문은 단일 목표 화자 발화 하나만으로도 고품질의 음성 변환을 가능하게 하는 인과 분리형 및 해석 가능한 표현 학습 방법을 제안한다. 이는 Factorized Hierarchical Variational Autoencoder (FHVAE)를 사용하여 일방적이고 비병렬인 다국어 음성 변환을 구현한다. VAE-STFT 및 GMM 기반 모델 대비 뛰어난 음성 품질과 화자 유사도를 보이며, 특히 STFT 대비 World 음성 합성기 특징을 활용함으로써 성능 향상을 이룬다.

ABSTRACT

We study the problem of cross-lingual voice conversion in non-parallel speech corpora and one-shot learning setting. Most prior work require either parallel speech corpora or enough amount of training data from a target speaker. However, we convert an arbitrary sentences of an arbitrary source speaker to target speaker's given only one target speaker training utterance. To achieve this, we formulate the problem as learning disentangled speaker-specific and context-specific representations and follow the idea of [1] which uses Factorized Hierarchical Variational Autoencoder (FHVAE). After training FHVAE on multi-speaker training data, given arbitrary source and target speakers' utterance, we estimate those latent representations and then reconstruct the desired utterance of converted voice to that of target speaker. We investigate the effectiveness of the approach by conducting voice conversion experiments with varying size of training utterances and it was able to achieve reasonable performance with even just one training utterance. We also examine the speech representation and show that World vocoder outperforms Short-time Fourier Transform (STFT) used in [1]. Finally, in the subjective tests, for one language and cross-lingual voice conversion, our approach achieved significantly better or comparable results compared to VAE-STFT and GMM baselines in speech quality and similarity.

연구 동기 및 목표

  • 비병렬이고 일방적인 설정에서 목표 화자 데이터가 극히 적은 조건에서 다국어 음성 변환 문제를 해결하기 위해.
  • 다양한 언어 간에 발음적 맥락과 화자 신원을 유지하는 데 효과적인 인과 분리형 및 해석 가능한 잠재 표현의 타당성을 탐구하기 위해.
  • 특히 World 음성 합성기와 STFT를 비교하여 음성 변환 성능 향상에 기여하는 다양한 음성 표현 방식의 영향을 평가하기 위해.
  • 학습용 소스 및 목표 화자 발화의 크기가 변할 경우 음성 변환 품질에 미치는 영향을 평가하기 위해.
  • 주관적 평가를 통해 제안된 방법이 VAE-STFT 및 GMM 기반 모델 대비 음성 품질과 화자 유사도 측면에서 어떻게 성능을 냈는지 비교하기 위해.

제안 방법

  • 모델은 화자 신원과 언어적 맥락을 분리하는 인과 분리형 잠재 표현을 학습하기 위해 Factorized Hierarchical Variational Autoencoder (FHVAE)를 사용한다.
  • 화자 신원에 대한 잠재 코드는 단일 목표 화자 발화에서, 발음적 맥락에 대한 잠재 코드는 소스 화자 발화에서 추론된다.
  • 모델은 소스 화자의 언어적 내용과 목표 화자의 화자 특화 표현을 조합하여 목표 화자의 음성을 재구성한다.
  • 음성 표현은 Mel-cepstrum (MCEP) 및 기타 음향 특징을 사용하여 평가되며, World 음성 합성기 특징이 STFT 대비 뛰어난 성능을 보였다.
  • 프레임워크는 다수의 화자 데이터로 훈련된 후, 최소한의 목표 화자 데이터로 일방적 추론을 위한 미세조정이 이루어진다.
  • 주관적 평가는 음성 품질과 화자 신원 유지 정도를 평가하기 위해 평균 의견 점수 (MOS) 및 동일/다른 화자 유사도 테스트를 사용한다.

실험 결과

연구 질문

  • RQ1단 한 명의 목표 화자 발화만으로도 인과 분리형 및 해석 가능한 표현이 효과적인 일방적 다국어 음성 변환을 가능하게 할 수 있는가?
  • RQ2음성 표현 선택(예: World 음성 합성기 대비 STFT)이 음성 변환 품질과 유사도에 어떤 영향을 미치는가?
  • RQ3목표 화자로부터의 학습 발화 수를 단 한 개로 줄였을 때 성능 저하 또는 안정성에 어떤 영향을 미치는가?
  • RQ4제안된 방법이 주관적 음성 품질과 화자 유사도 측면에서 VAE-STFT 및 GMM 기반 모델 대비 어떻게 성능을 냈는가?
  • RQ5다양한 언어와 성별 조합에서 다국어 설정에서 모델이 잘 일반화되는가?

주요 결과

  • 주관적 음성 품질 평가에서 제안된 방법은 VAE-STFT 대비 평균 MOS 점수에서 +1.25 ± 0.12 향상되었으며, p < 0.0001로 매우 유의미한 개선을 보였다.
  • GMM 기반 모델 대비 제안된 방법은 모든 언어 및 성별 조합에서 평균 MOS 점수에서 +0.61 ± 0.14 향상되었으며, p < 0.05로 유의미한 개선이 있었다.
  • World 음성 합성기 특징은 음성 품질과 화자 유사도 양 측면에서 STFT를 능가하여, 음성 변환을 위한 표현 학습에서의 우수성을 입증했다.
  • 목표 화자 발화가 단 한 개일 경우에도 모델은 합리적인 성능을 달성하였으며, 음성 품질 측면에서 기반 모델들을 크게 앞서는 성능을 보였다.
  • 화자 유사도 테스트 결과, GMM 및 VAE 시스템 간 유의미한 차이가 없었으며, 각각 -0.12 ± 0.16 (VAE) 및 -0.18 ± 0.15 (GMM)의 점수를 기록했지만, E2E 변환에서 가장 높은 화자 신원 유지 성능를 보였다.
  • Z2Z(동일 언어) 변환은 교차 언어 쌍(E2Z, Z2E)보다 더 높은 유사도 점수를 기록하여 청취자 인식에서 언어 매칭 편향이 존재함을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.