Skip to main content
QUICK REVIEW

[논문 리뷰] CycleTransGAN-EVC: A CycleGAN-based Emotional Voice Conversion Model with Transformer

Changzeng Fu, Chaoran Liu|arXiv (Cornell University)|2021. 11. 30.
Speech Recognition and Synthesis참고 문헌 22인용 수 8
한 줄 요약

이 논문은 순환적 가중치를 가진 변환기 기반 모델인 CycleTransGAN-EVC를 제안하며, 시간적 모델링과 수신 영역을 향상시켜 병렬 학습 데이터 없이도 고품질이고 안정적인 감정성 음성 변환을 가능하게 한다. 주관적 평가에서 감정 강도와 자연스러움이 뛰어나며, 특히 커리큘럼 학습을 통한 성능 향상으로 ACVAE 및 CycleGAN 기준 모델을 능가한다.

ABSTRACT

In this study, we explore the transformer's ability to capture intra-relations among frames by augmenting the receptive field of models. Concretely, we propose a CycleGAN-based model with the transformer and investigate its ability in the emotional voice conversion task. In the training procedure, we adopt curriculum learning to gradually increase the frame length so that the model can see from the short segment till the entire speech. The proposed method was evaluated on the Japanese emotional speech dataset and compared to several baselines (ACVAE, CycleGAN) with objective and subjective evaluations. The results show that our proposed model is able to convert emotion with higher strength and quality.

연구 동기 및 목표

  • 감정 음성 변환 과정에서 장거리 시간적 의존성을 포착하고 음성 안정성을 유지하는 데 어려움을 겪는 CNN 기반 모델의 한계를 해결하기 위해.
  • 변환기 모델이 음성 변환 과제에서 프레임 내 관계를 모델링하고 수신 영역을 넓히는 데 효과적인지 조사하기 위해.
  • 비병렬 학습 데이터에 의존도를 줄이기 위해 순환 일致성 있는 적대적 네트워크를 활용한 비병렬 감정성 음성 변환을 위해.
  • 커리큘럼 학습과 미세 조절된 구분자들을 통해 감정 강도, 음성 품질, 자연스러움을 향상시키기 위해.

제안 방법

  • 모델는 원본 감정 음성과 목표 감정 음성 간의 순환 일치 맵핑을 학습하기 위해 두 개의 생성자와 두 개의 구분자를 사용하는 CycleGAN 프레임워크를 사용한다.
  • 장거리 시간적 의존성을 모델링하고 CNN이 달성할 수 있는 것 이상의 수신 영역을 향상시키기 위해 변환기가 내장된 변환기를 통합한다.
  • 입력 특징은 F0(기본 주파수)와 스펙트로그램이며, F0는 연속 웨이블릿 변환(CWT)을, 스펙트로그램은 CheapTrick을 사용해 추출한다.
  • 커리큘럼 학습 전략을 통해 학습 에포크 동안 입력 시퀀스 길이를 짧은 세그먼트에서 전체 문장으로 점차 증가시켜 학습 안정성과 감정 특징 캡처 능력을 향상시킨다.
  • 로컬 감정 일관성을 평가하기 위해 미세 조절 수준의 구분자를 도입했지만, 전체 감정 유사도는 약간 감소시킨다.
  • 전반적인 손실는 적대적 손실, 순환 일치 손실, 정체성 손실의 조합이며, 하이퍼파ram터는 학습 도중 조정된다.

실험 결과

연구 질문

  • RQ1CNN 기반 모델에 비해 변환기가 감정 음성 변환에서 내부 시간적 의존성 모델링에 얼마나 기여하는가?
  • RQ2짧은 음성 세그먼트에서 시작하여 점차 시퀀스 길이를 늘리는 커리큘럼 학습 전략이 감정 특징 학습 능력을 향상시키는가?
  • RQ3미세 조절된 구분자의 통합이 비병렬 음성 변환에서 감정 충실도와 음성 자연스러움에 어떤 영향을 미치는가?
  • RQ4제안된 CycleTransGAN-EVC 모델이 기존 기준 모델(ACVAE, CycleGAN)에 비해 감정 강도, 음성 품질, 자연스러움 측면에서 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • CycleTransGAN-All 모델은 음성 품질과 자연스러움에 대해 가장 높은 평균 관점 점수(MOS)를 기록했으며, 모든 기준 모델 및 추상화 변형보다 뛰어났다.
  • 감정 유사도 측면에서 CycleTransGAN-CL(미세 조절된 구분자 제외)가 분노와 슬픔 감정에 대해 가장 높은 MOS를 기록했으며, 이는 미세 조절된 구분자가 주요 감정 특징에서 산만해질 수 있음을 시사한다.
  • CycleTransGAN-All은 기쁨 감정에 대해 가장 높은 MOS를 기록했으며, 이는 고에너지 감정 변환에서 뛰어난 성능을 보임을 의미한다.
  • 커리큘럼 학습의 사용은 감정 특징 학습 능력을 크게 향상시켰으며, 특히 감정 신호가 더 집중된 짧은 세그먼트에서 두드러진다.
  • 비록 향상된 점이 있었지만, 생성된 음성의 명료성과 감정 강도는 여전히 향상이 필요하여 향후 최적화 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.