Skip to main content
QUICK REVIEW

[논문 리뷰] A Vocoder-free WaveNet Voice Conversion with Non-Parallel Data

Xiaohai Tian, Eng Siong Chng|arXiv (Cornell University)|2019. 02. 11.
Speech Recognition and Synthesis참고 문헌 32인용 수 6
한 줄 요약

이 논문은 중간 단계의 보코더 특징이 필요 없이 직접 원시 파형 샘플로 변환하는 보코더-무료 WaveNet 기반 음성 변환 시스템을 제안한다. 이는 음성의 품질 저하를 유발하는 특징 추정 오차를 방지하기 위해 파arametric 보코더를 사용하지 않으며, 특징 불일치 문제를 해결하기 위해 발화자 독립적인 음성 후행도그램(PPGs)을 입력으로 사용한다. 이 방법은 중간 단계의 보코더를 생략하고 특징 불일치 문제를 피함으로써 기준 방법들보다 훨씬 높은 음성 품질을 달성한다. 주관적 평가 결과, 청취자들이 더 나은 청취 품질과 더 높은 발화자 유사성을 경험한다.

ABSTRACT

In a typical voice conversion system, vocoder is commonly used for speech-to-features analysis and features-to-speech synthesis. However, vocoder can be a source of speech quality degradation. This paper presents a vocoder-free voice conversion approach using WaveNet for non-parallel training data. Instead of dealing with the intermediate features, the proposed approach utilizes the WaveNet to map the Phonetic PosteriorGrams (PPGs) to the waveform samples directly. In this way, we avoid the estimation errors caused by vocoder and feature conversion. Additionally, as PPG is assumed to be speaker independent, the proposed method also reduces the feature mismatch problem in WaveNet vocoder based approaches. Experimental results conducted on the CMU-ARCTIC database show that the proposed approach significantly outperforms the baseline approaches in terms of speech quality.

연구 동기 및 목표

  • 특징 추정 오차로 인한 음성 품질 저하를 방지하기 위해 음성 변환에서 파arametric 보코더의 사용을 제거하기 위해.
  • WaveNet 보코더 기반 음성 변환 시스템에서 발생하는 특징 불일치 문제를 해결하기 위해 발화자 독립적인 PPGs를 입력으로 사용하기 위해.
  • 원천 및 대상 발화자 간의 병렬 학습 데이터가 필요 없이 엔드 투 엔드 음성 변환을 가능하게 하기 위해.
  • 조건부 WaveNet을 사용하여 PPGs에서 직접 원시 파형을 생성함으로써 음성 품질을 향상시키기 위해.
  • 높은 청취 품질을 달성하면서도 발화자 신원을 유지하기 위해.

제안 방법

  • 발화자 독립적인 음성 특징으로서의 음성 후행도그램(PPGs)을 사용하며, 이는 사전에 학습된 모델을 통해 원천 음성에서 추출된다.
  • 조건부 WaveNet은 PPGs를 국소 조건 입력으로 사용하여 직접 원시 파형 샘플을 생성하도록 학습된다.
  • 모델은 중간 단계의 스펙트럼 특징이나 보코더 단계 없이 PPGs에서 시간 도메인 음성 샘플로의 매핑을 학습한다.
  • 학습 과정은 원천-대상 음성 쌍의 병렬 데이터가 필요 없으며, 각 발화자에 대해 단일 언어 음성 데이터만 필요하다.
  • WaveNet 아키텍처는 확장된 인과적 컨벌루션, 게이팅 활성화 유닛, 잔여 연결을 사용하여 장거리 시간적 의존성을 모델링한다.
  • 모델은 고정 학습률 0.0001, 15,000 미니배치 크기, 200,000 학습 스텝로 Adam 옵timizer를 사용하며, 파형 진폭은 16비트 μ-law 인코딩을 사용한다.

실험 결과

연구 질문

  • RQ1보코더-무료 음성 변환 시스템이 전통적인 WaveNet 보코더 기반 방법보다 더 높은 음성 품질을 달성할 수 있는가?
  • RQ2발화자 독립적인 PPGs를 입력으로 사용함으로써 WaveNet 기반 음성 변환에서 발생하는 특징 불일치 문제를 줄일 수 있는가?
  • RQ3PPGs에서 직접 파형을 생성하는 것이 중간 단계의 스펙트럼 특징과 보코더에 의존하는 시스템보다 우수한 성능을 낼 수 있는가?
  • RQ4기준 GMM 및 WaveNet 기반 시스템과 비교할 때 제안된 방법의 음성 품질 및 발화자 유사성 측면에서의 성능은 어떠한가?
  • RQ5원천 및 대상 발화자 간에 병렬 학습 데이터가 필요 없이 고품질 음성 변환 시스템을 학습하는 것이 가능한가?

주요 결과

  • 제안된 WaveNet-VC 방법은 모든 테스트 쌍에서 평균 RMSE 13.73 dB를 기록하여 WaveNet-PPG 기준(14.61 dB)을 초월했으며, GMM-WaveNet 기준과도 경쟁 가능한 성능을 보였다.
  • 주관적 품질 선호도 테스트 결과, WaveNet-VC는 WaveNet-PPG 및 GMM-WaveNet 기준 모두를 유의미하게 뛰어넘었으며, p-값이 통계적 유의성을 나타냈다.
  • 발화자 유사성 선호도 테스트에서 WaveNet-VC는 WaveNet-PPG보다 유의미하게 뛰어났지만, GMM-WaveNet 또는 GMM(GV)-WaveNet와 비교해 발화자 정체성 유지 측면에서 유의미한 차이가 없었다.
  • 전통적인 보코더를 사용하지 않음에도 불구하고 뛰어난 청취 품질을 달성하여, PPGs에서 직접 파형을 생성하는 것이 효과적임을 입증했다.
  • 파arametric 보코더가 없어져 잡음과 추정 오차가 감소하여 더 깔끔하고 자연스러운 청취 품질의 변환 음성 결과를 얻을 수 있었다.
  • 보코더 기반 기준 시스템보다 더 높은 음성 품질을 유지하면서도 높은 발화자 유사성을 유지함으로써 품질과 정체성 유지 사이의 유리한 트레이드오프를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.