Skip to main content
QUICK REVIEW

[논문 리뷰] Spectrum and Prosody Conversion for Cross-lingual Voice Conversion with CycleGAN

Zongyang Du, Kun Zhou|arXiv (Cornell University)|2020. 08. 11.
Speech Recognition and Synthesis참고 문헌 58인용 수 7
한 줄 요약

이 논문은 병렬 데이터 없이도 학습할 수 있도록 연속 파동수형 변환(CWT)을 활용한 스펙트럼과 프로소디를 동시에 모델링하는 새로운 CycleGAN 기반 프레임워크를 제안한다. 이는 F0의 연속 파동수형 변환(CWT) 분해를 통해 비병렬, 정렬 없이 학습이 가능하게 한다. 스펙트럼 전용 CycleGAN 기반 모델 대비 발화자 유사도에서 뛰어난 성능을 보이며, CWT를 통한 계층적 프로소디 모델링이 다국어 환경에서 자연스러움과 목표 발화자 유사도 향상에 크게 기여함을 입증한다.

ABSTRACT

Cross-lingual voice conversion aims to change source speaker's voice to sound like that of target speaker, when source and target speakers speak different languages. It relies on non-parallel training data from two different languages, hence, is more challenging than mono-lingual voice conversion. Previous studies on cross-lingual voice conversion mainly focus on spectral conversion with a linear transformation for F0 transfer. However, as an important prosodic factor, F0 is inherently hierarchical, thus it is insufficient to just use a linear method for conversion. We propose the use of continuous wavelet transform (CWT) decomposition for F0 modeling. CWT provides a way to decompose a signal into different temporal scales that explain prosody in different time resolutions. We also propose to train two CycleGAN pipelines for spectrum and prosody mapping respectively. In this way, we eliminate the need for parallel data of any two languages and any alignment techniques. Experimental results show that our proposed Spectrum-Prosody-CycleGAN framework outperforms the Spectrum-CycleGAN baseline in subjective evaluation. To our best knowledge, this is the first study of prosody in cross-lingual voice conversion.

연구 동기 및 목표

  • 병렬 학습 데이터나 발화자 정렬이 없는 다국어 음성 변환의 과제를 해결하기 위해.
  • 시간적 스케일에 따라 다양하게 변화하는 F0의 계층적 변동을 포착함으로써 다국어 음성 변환에서 프로소디 모델링을 향상시키기 위해.
  • 복잡한 프로소디적 종속성을 모델링하지 못하는 선형 또는 통계적 F0 변환 방법에 의존하는 것을 피하기 위해.
  • 스펙트럼과 프로소디 매핑을 동시에 학습할 수 있는 통합 프레임워크를 개발하여 비병렬 데이터 기반 CycleGAN을 활용하기 위해.
  • CWT 기반 프로소디 표현이 다국어 변환에서 발화자 유사도와 음성 품질 향상에 기여하는지 검증하기 위해.

제안 방법

  • 프레임워크는 스펙트럼 매핑과 프로소디 매핑을 위한 별도의 두 개의 CycleGAN 파이프라인을 사용하며, 이는 비병렬 데이터에서 독립적으로 학습된다.
  • 프로소디 모델링은 F0를 다중 척도 시간-주파수 계수로 분해하는 연속 파동수형 변환(CWT)을 활용하여 단기적·장기적 피치 흐름을 모두 포착한다.
  • CWT 계수를 기반으로 CycleGAN 기반의 프로소디 매핑 네트워크에 입력하여 언어 간 프로소디의 계층적 구조를 유지한다.
  • 스펙트럼과 프로소디는 각각 1D 및 2D CNN 기반 생성자와 판별자로 처리되어 시간적·스펙트럼적 무늬를 유지한다.
  • 학습 목표는 사이클 일致성 손실($L_{CYC}$)과 아이덴티티 손실($L_{ID}$)의 조합이며, 안정성과 성능 향상을 위해 하이퍼파ram터가 조정된다.
  • 이중 단계 학습 스케줄을 사용한다: 첫 $10^4$ 반복 동안 $L_{ID}$만 적용하고, 이후 $L_{CYC}$와 $L_{ID}$를 함께 전체 학습에 적용한다.

실험 결과

연구 질문

  • RQ1선형 또는 통계적 방법에 비해 CWT 기반 다중 척도 F0 표현이 다국어 음성 변환에서 프로소디 모델링을 향상시키는가?
  • RQ2비병렬 데이터가 존재하는 상황에서 별도의 CycleGAN 파이프라인을 통해 프로소디 매핑을 수행하면 발화자 유사도가 향상되는가?
  • RQ3제안된 스펙트럼-프로소디 CycleGAN 프레임워크는 주관적 품질과 발화자 유사도 측면에서 스펙트럼 전용 CycleGAN보다 나은가?
  • RQ4비병렬, 비정렬 학습 데이터만으로도 고품질의 다국어 음성 변환을 달성하고 프로소디 전달 성능을 향상시킬 수 있는가?
  • RQ5다국어 프로소디 전달 맥락에서 F0의 계층적 특성이 CWT 분해를 통해 충분히 포착되는가?

주요 결과

  • 제안된 스펙트럼-프로소디-CycleGAN 프레임워크는 영어 → 중국어 변환에서 평균 평가 점수(MOS) 2.92 ± 0.27, 중국어 → 영어 변환에서 3.34 ± 0.29를 기록하여 스펙트럼 전용 기반 모델과 유사한 음성 품질을 확보하였다.
  • XAB 선호도 테스트 결과, 제안된 방법은 발화자 유사도 측면에서 기반 모델을 뚜렷이 앞서며, $en2cn$ 및 $cn2en$ 양 방향 모두에서 다수의 평가자가 프로소디 강화 출력을 선호하였다.
  • 결과는 CWT 기반 F0 모델링이 다양한 시간 스케일에서 계층적 프로소디 패턴을 효과적으로 포착하여 자연스러움과 목표 발화자 유사도 향상에 기여함을 보여준다.
  • 스펙트럼과 프로소디에 대해 별도의 CycleGAN 파이프라인을 사용함으로써 비병렬 데이터에서 효과적인 정렬 없이 학습이 가능해졌으며, 이는 프레임워크의 강건성을 검증한다.
  • 이 프레임워크는 딥 생성 모델을 활용해 다국어 음성 변환에서 프로소디를 명시적으로 모델링한 최초의 사례로, 분야 내 중요한 발전을 이룬다.
  • 제거 실험(ablation study) 결과, CWT와 CycleGAN을 통한 프로소디 모델링이 발화자 유사도 향상에 필수적임을 확인하였으며, 프로소디 변환 없이 학습된 기반 모델은 주관적 평가에서 유의미하게 열 劣한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.