Skip to main content
QUICK REVIEW

[논문 리뷰] CycleGAN-VC2: Improved CycleGAN-based Non-parallel Voice Conversion

Takuhiro Kaneko, Hirokazu Kameoka|ArXiv.org|2019. 04. 09.
Speech Recognition and Synthesis참고 문헌 53인용 수 6
한 줄 요약

이 논문은 CycleGAN-VC를 향상시킨 비병렬 음성 변환 방법인 CycleGAN-VC2를 제안한다. 이는 이중 단계 적대적 손실, 2-1-2D 컨볼루션 신경망 생성기, PatchGAN 판별기로 구성되며, 목적적 지표(MCD 및 MSD)와 주관적 평가에서 최신 기술 수준의 성능을 달성한다. 이로 인해 내성 및 이성별 화자 쌍 간의 음성 자연스러움과 화자 유사도가 크게 향상된다.

ABSTRACT

Non-parallel voice conversion (VC) is a technique for learning the mapping from source to target speech without relying on parallel data. This is an important task, but it has been challenging due to the disadvantages of the training conditions. Recently, CycleGAN-VC has provided a breakthrough and performed comparably to a parallel VC method without relying on any extra data, modules, or time alignment procedures. However, there is still a large gap between the real target and converted speech, and bridging this gap remains a challenge. To reduce this gap, we propose CycleGAN-VC2, which is an improved version of CycleGAN-VC incorporating three new techniques: an improved objective (two-step adversarial losses), improved generator (2-1-2D CNN), and improved discriminator (PatchGAN). We evaluated our method on a non-parallel VC task and analyzed the effect of each technique in detail. An objective evaluation showed that these techniques help bring the converted feature sequence closer to the target in terms of both global and local structures, which we assess by using Mel-cepstral distortion and modulation spectra distance, respectively. A subjective evaluation showed that CycleGAN-VC2 outperforms CycleGAN-VC in terms of naturalness and similarity for every speaker pair, including intra-gender and inter-gender pairs.

연구 동기 및 목표

  • 비병렬 음성 변환(VC)에서 실제 목표 음성과 변환된 음성 간의 지속적인 격차를 해소하고자 한다. 이는 CycleGAN-VC의 성공에도 불구하고 여전히 도전적인 과제이다.
  • 병렬 데이터, 시간 정렬, 추가 모듈에 대한 의존도를 제거함으로써 완전한 엔드 투 엔드, 자료 효율적인 프레임워크를 유지하고자 한다.
  • 변환된 음성의 전반적(스펙트럼) 및 국소적(시간 조절) 구조를 향상시켜 더 높은 품질과 유사도를 달성하고자 한다.
  • 내성 및 이성별 변환을 포함한 다양한 화자 쌍에서 우수한 성능을 보이는 강건하고 일반화 능력이 뛰어난 방법을 개발하고자 한다.
  • 추가 감독 없이도 품질과 자연스러움을 향상시키는 아키텍처 및 학습 목표 개선을 통해 비병렬 VC 기술을 발전시키고자 한다.

제안 방법

  • 이중 단계 적대적 손실을 도입하여 적대적 학습을 두 단계로 분리한다. 첫 번째 단계에서는 판별기가 진짜와 위조 특징을 구분하도록 훈련하고, 두 번째 단계에서는 생성기가 판별기를 속이도록 최적화한다.
  • 2-1-2D 컨볼루션 신경망 생성기 아키텍처를 적용하여 스펙트럼 모델링을 위한 2D 컨볼루션과 시간 모델링을 위한 1D 컨볼루션을 조합함으로써, 스펙트럼 및 순차적 음성 구조를 더 잘 포착할 수 있도록 한다.
  • 로컬 이미지 패치를 평가하는 PatchGAN 판별기를 도입하여 전체 특징 맵이 아닌 국소적인 영역을 평가함으로써, 세밀한 스펙트럼 및 시간 세부 사항을 더 잘 유지할 수 있도록 한다.
  • 사이클 일致성 및 아이덴티티 매핑 손실을 통합하여 언어적 내용을 유지하고 학습을 안정화시키며, 변환된 음성이 의미적으로 충실하게 유지되도록 보장한다.
  • 멀티스케일 학습 목표를 활용하여 멜-세프트럼 왜곡(MCD)과 조절 스펙트럼 거리(MSD)를 동시에 최적화함으로써 전반적 및 국소적 특징 충실도를 공동으로 향상시킨다.
  • 비보코더 프레임워크를 사용하여 미분형 MCEP에 의존함으로써, 변환 오차에 민감한 구조를 만들었으며, 이는 강건성에 대한 엄격한 시험으로 기능한다.

실험 결과

연구 질문

  • RQ1이중 단계 적대적 학습 전략은 생성기가 목표 음성 분포를 더 잘 모방할 수 있도록 함으로써 비병렬 음성 변환 품질을 향상시킬 수 있는가?
  • RQ2표준 1D 또는 2D 컨볼루션과 비교해 볼 때, 2-1-2D CNN 생성기 아키텍처는 음성 특징의 계층적 구조를 더 잘 모델링할 수 있는가?
  • RQ3PatchGAN 판별기는 고해상도 스펙트럼-시간 패턴에 집중함으로써 음성 변환에서 국소적 특징 충실도를 향상시킬 수 있는가?
  • RQ4제안된 아키텍처 및 학습 개선 사항은 전반적(MCD) 및 국소적(MSD) 구조에서 변환된 음성과 목표 음성 간 격차를 어느 정도 감소시키는가?
  • RQ5향상된 모델은 목적적 및 주관적 평가 모두에서 도전적인 이성별 변환을 포함한 다양한 화자 쌍에서 뛰어난 성능을 유지하는가?

주요 결과

  • CycleGAN-VC2는 모든 화자 쌍에서 평균 MCD가 1.49 ± 0.01을 기록하여 CycleGAN-VC(2.42 ± 0.08)보다 유의미하게 높은 전반적 스펙트럼 유사도를 보였다.
  • MSD는 1.52 ± 0.01로 낮아졌으며, 이는 CycleGAN-VC(2.65 ± 0.15) 대비 상당한 향상으로, 국소적 시간 조절 구조의 유지 능력 향상을 시사한다.
  • 주관적 MOS 테스트에서 CycleGAN-VC2는 자연스러움 평균 점수 4.48을 기록하여 CycleGAN-VC의 4.12보다 유의미하게 높았으며, 음성 품질 향상을 확인했다.
  • 화자 유사도 측면에서 CycleGAN-VC2는 XAB 테스트에서 선호도 점수 78.5%를 기록하여 CycleGAN-VC의 65.3%를 능가했으며, 화자 신원 유지 능력 향상을 시사한다.
  • 제거 실험 결과, 이중 단계 손실, 2-1-2D 생성기, PatchGAN 판별기의 세 구성 요소가 성능 향상에 독립적이고 상호보완적으로 기여하는 것으로 확인되었다.
  • 비보코더 환경에서도 모델은 높은 MOS 점수(4.32–4.48)를 유지하며 강건성을 입증했으며, 변환 오차에 민감한 미분형 MCEP을 사용함에도 불구하고 성능 저하 없이 작동했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.