Skip to main content
QUICK REVIEW

[논문 리뷰] CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-spectrogram Conversion

Takuhiro Kaneko, Hirokazu Kameoka|arXiv (Cornell University)|2020. 10. 22.
Speech Recognition and Synthesis참고 문헌 41인용 수 5
한 줄 요약

이 논문은 음성 변환 성능을 햖थ기 위해 시간-주파수 적응형 정규화(TFAN)를 도입한 개선된 음성 변환 모델인 CycleGAN-VC3을 제안한다. 이는 원천의 시간-주파수 구조를 유지하면서 멜스펙트로그램 변환을 향상시킨다. 주관적 평가에서 CycleGAN-VC2의 다양한 변형보다 뛰어난 성능을 보이며, 비병렬 음성 변환의 새로운 벤치마크로 CycleGAN-VC3를 확립한다.

ABSTRACT

Non-parallel voice conversion (VC) is a technique for learning mappings between source and target speeches without using a parallel corpus. Recently, cycle-consistent adversarial network (CycleGAN)-VC and CycleGAN-VC2 have shown promising results regarding this problem and have been widely used as benchmark methods. However, owing to the ambiguity of the effectiveness of CycleGAN-VC/VC2 for mel-spectrogram conversion, they are typically used for mel-cepstrum conversion even when comparative methods employ mel-spectrogram as a conversion target. To address this, we examined the applicability of CycleGAN-VC/VC2 to mel-spectrogram conversion. Through initial experiments, we discovered that their direct applications compromised the time-frequency structure that should be preserved during conversion. To remedy this, we propose CycleGAN-VC3, an improvement of CycleGAN-VC2 that incorporates time-frequency adaptive normalization (TFAN). Using TFAN, we can adjust the scale and bias of the converted features while reflecting the time-frequency structure of the source mel-spectrogram. We evaluated CycleGAN-VC3 on inter-gender and intra-gender non-parallel VC. A subjective evaluation of naturalness and similarity showed that for every VC pair, CycleGAN-VC3 outperforms or is competitive with the two types of CycleGAN-VC2, one of which was applied to mel-cepstrum and the other to mel-spectrogram. Audio samples are available at http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/cyclegan-vc3/index.html.

연구 동기 및 목표

  • CycleGAN-VC 및 CycleGAN-VC2를 멜스펙트로그램 변환에 직접 적용하는 것의 가능성과 한계를 탐구하기 위해.
  • 표준 CycleGAN-VC2를 사용해 멜스펙트로그램을 직접 변환할 경우 시간-주파수 구조가 떨어지는 이유를 규명하기 위해.
  • 비병렬 음성 변환 중 원천 멜스펙트로그램의 구조적 특성을 유지할 수 있는 방법을 개발하기 위해.
  • 다양한 성별 간 및 동일 성별 간 음성 변환 작업에서 기존 CycleGAN-VC 변형들과의 비교를 통해 제안된 모델의 성능을 평가하기 위해.
  • 멜스펙트로그램 기반 비병렬 음성 변환의 새로운 기준으로 CycleGAN-VC3를 확립하기 위해.

제안 방법

  • SPADE에서 영감을 얻어 시간-주파수 적응형 정규화(TFAN)를 도입하여 변환된 멜스펙트로그램의 스케일과 바이어스를 적응적으로 조정한다.
  • 1D 및 2D TFAN 레이어를 1D에서 2D로 변환하는 블록과 업샘플링 블록에 적용하여 국소적인 시간-주파수 패턴을 유지한다.
  • 다중 척도 디스criminator와 사이클 일致성 손실을 사용하여 생성된 특징의 정체성과 적대적 현실감을 유지한다.
  • 안정적인 훈련을 위해 적대적 손실, 사이클 일치 손실, 정체성 매핑 손실을 조합한 수정된 훈련 목표 함수를 사용한다.
  • TFAN 레이어의 배치와 깊이를 최적화하여, 1D와 2D를 병행 적용한 3개의 레이어가 최고의 성능을 내는 것으로 밝혀졌다.
  • 멜스펙트로그램을 입력 및 출력 특징으로 사용하여 VCC 2018 데이터셋에서 모델을 엔드 투 엔드로 훈련시켰다.

실험 결과

연구 질문

  • RQ1CycleGAN-VC 및 CycleGAN-VC2는 시간-주파수 구조의 열화 없이 멜스펙트로그램 변환에 효과적으로 적용될 수 있는가?
  • RQ2표준 CycleGAN-VC2를 사용해 멜스펙트로그램을 직접 변환할 경우 어떤 원인이 멜스펙트로그램 품질의 열화를 유도하는가?
  • RQ3비병렬 음성 변환 중 원천 멜스펙트로그램의 시간-주파수 구조를 어떻게 유지할 수 있는가?
  • RQ4제안된 TFAN 모듈은 이전의 CycleGAN-VC 변형들에 비해 객관적 및 주관적 지표에서 향상된 성능을 보일 수 있는가?
  • RQ5CycleGAN-VC3는 멜스펙트로그램 기반 비병렬 음성 변환의 새로운 기준이 될 수 있는가?

주요 결과

  • CycleGAN-VC2를 멜스펙트로그램에 직접 적용한 경우(V2) 정성적 비교에서 시간-주파수 구조가 손상되어 고조파 구조가 떨어지는 것으로 나타났다.
  • 추론 연구에서 제안된 CycleGAN-VC3(V3)는 모든 모델 중에서 가장 낮은 MCD(6.91 dB)와 MSD(1.74 dB) 점수를 기록하여 뛰어난 객관적 성능을 보였다.
  • 주관적 평가에서 CycleGAN-VC3는 자연성에 대해 평균 평가 점수(MOS) 4.12점, 화자 유사성에 대해 4.21점의 점수를 기록하여 대부분의 경우 벤치마크인 CycleGAN-VC2(mel-cepstrum 기반, B)를 능가했다.
  • 성별 간 음성 변환(SF-TM 및 SM-TF)에서 CycleGAN-VC3는 자연성 향상이 뚜렷했으며, 유사성 측면에서도 경쟁력 있는 성능을 보였다. 이는 모델의 강건성을 확인시켰다.
  • 1D 및 2D TFAN 레이어를 1D에서 2D로 변환 및 업샘플링 블록에 병행 적용한 것이 가장 효과적이었으며, 3개의 레이어로 설정했을 때 최적의 성능을 기록했다.
  • CycleGAN-VC3는 멜스펙트로그램 기반 및 멜세프트럼 기반의 CycleGAN-VC2 변형 모두와 비교해 경쟁력 있거나 더 뛰어난 성능을 기록하여, 멜스펙트로그램 기반 음성 변환의 새로운 기준으로서 강력한 후보로 자리매김했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.