Skip to main content
QUICK REVIEW

[논문 리뷰] High-quality nonparallel voice conversion based on cycle-consistent adversarial network

Fuming Fang, Junichi Yamagishi|arXiv (Cornell University)|2018. 04. 02.
Speech and Audio Processing인용 수 12
한 줄 요약

이 논문은 병렬 학습 데이터가 필요 없이 음성 스타일 전이를 학습하는 Cycle-GAN을 사용한 고품질 비병렬 음성 변환 방법을 제안한다. 사이클 일관성과 적대적 학습을 활용하여, 최신 병렬 VC 시스템에 비해 더 뛰어난 음성 품질과 화자 유사도를 달성한다. 주관적 평가에서 비병렬 VC가 전통적인 병렬 방법을 능가할 수 있음을 입증한다.

ABSTRACT

Although voice conversion (VC) algorithms have achieved remarkable success along with the development of machine learning, superior performance is still difficult to achieve when using nonparallel data. In this paper, we propose using a cycle-consistent adversarial network (CycleGAN) for nonparallel data-based VC training. A CycleGAN is a generative adversarial network (GAN) originally developed for unpaired image-to-image translation. A subjective evaluation of inter-gender conversion demonstrated that the proposed method significantly outperformed a method based on the Merlin open source neural network speech synthesis system (a parallel VC system adapted for our setup) and a GAN-based parallel VC system. This is the first research to show that the performance of a nonparallel VC method can exceed that of state-of-the-art parallel VC methods.

연구 동기 및 목표

  • 실제로 수집하기 어려운 병렬 학습 데이터가 필요 없는 고품질 음성 변환 시스템을 개발하는 것.
  • 강제 정렬에 의존하거나 언어적 불일치에 민감한 병렬 VC 시스템의 한계를 극복하는 것.
  • Cycle-GAN을 사용한 비병렬 VC가 주관적 품질과 화자 유사도 측면에서 기존 병렬 VC 방법을 능가할 수 있는지 탐구하는 것.
  • 비대응 화자 데이터를 사용한 사이클 일관성 적대적 네트워크의 음성 변환 가능성 탐색.
  • 프레임 수준의 정렬이 필요 없이 음성 변환의 강건성과 일반화 능력을 향상시키는 것.

제안 방법

  • 모델은 두 개의 생성자와 두 개의 판별기를 포함한 Cycle-GAN 아키텍처를 사용하여 원본 화자 임베딩과 대상 화자 임베딩 간의 사이클 일관성 맵핑을 학습한다.
  • 생성자는 한 화자의 음성 특징을 다른 화자로 변환하도록 학습되며, 사이클 일관성 손실를 최소화하여 이중 변환 후 재구성된 출력이 원본 입력과 일치하도록 보장한다.
  • 적대적 손실는 생성된 음성이 판별기의 판단에서 실제 대상 화자 샘플과 구분되지 않도록 적용된다.
  • 입력과 출력 표현으로 멜-세프스트럼 특징을 사용하며, 대상 화자의 전역 평균과 표준편차를 사용해 F0 정규화를 수행한다.
  • 강제 정렬이나 언어적 내용 일치 없이도 원본 화자와 대상 화자로부터의 비대응 발화 문장을 사용해 학습을 수행한다.
  • 랜덤 시드 선택을 하이퍼파라미터로 사용하여 학습 안정성과 변환된 음성의 언어적 불변성을 향상시킨다.

실험 결과

연구 질문

  • RQ1Cycle-GAN 기반의 비병렬 음성 변환 시스템은 최신 병렬 VC 시스템보다 더 뛰어난 주관적 음성 품질을 달성할 수 있는가?
  • RQ2비병렬 학습에서 강제 정렬이 없음으로써 병렬 방법 대비 오류 전파가 감소하는가?
  • RQ3사이클 일관성 손실는 음성 변환 중 언어적 내용을 어떻게 유지하는가?
  • RQ4왜 남성에서 여성으로의 변환 성능이 떨어지며, 이를 어떻게 개선할 수 있는가?
  • RQ5명시적인 언어 제약 없이도 Cycle-GAN 기반 접근이 음성 스타일 전이 중 언어 정체성을 얼마나 유지할 수 있는가?

주요 결과

  • 제안된 CycleGAN 기반의 비병렬 VC 방법은 음성 품질에 대해 평균 평가 점수(MOS) 2.69, 화자 유사도에 대해 2.15를 기록하여, GAN 기반 병렬 기준선(MOS 2.36 및 2.02)과 Merlin 기반 병렬 기준선(MOS 1.45 및 1.45)을 크게 앞서는 성능을 보였다.
  • 여성에서 남성으로의 변환에서는 음성 품질에 대해 2.89, 화자 유사도에 대해 2.53을 기록하여 GAN 기반 방법(2.20 및 2.26)과 Merlin 기준선(1.37 및 1.52)을 초월했다.
  • 남성에서 여성으로의 변환에서는 음성 품질에 대해 2.50, 화자 유사도에 대해 1.76을 기록하여 GAN 기반 방법(2.51 및 1.79)과 Merlin 기준선(1.52 및 1.38)을 능가했다.
  • 남성에서 여성으로의 변환 성능 격차는 F0 불일치와 부족한 멜-세프스트럼 차원 수(25차원)로 인한 것으로 분석되었으며, F0 공동 학습과 특징 차원 조정을 통해 성능 향상을 기대할 수 있다.
  • 모델은 비병렬 VC가 주관적 평가에서 최신 병렬 VC 시스템을 능가할 수 있음을 입증하여, 병렬 데이터가 고품질 변환에 필수적이라는 가정을 도전했다.
  • 일부 언어 왜곡(예: /a:/ → /I:/)이 있었지만, 적절한 랜덤 시드 선택으로 인해 모델은 강건한 맵핑을 학습할 수 있었으며, 이는 초기화가 언어 불변성을 달성하는 데 중요한 역할을 함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.