Skip to main content
QUICK REVIEW

[논문 리뷰] Emotional Voice Conversion With Cycle-consistent Adversarial Network

Songxiang Liu, Yuewen Cao|arXiv (Cornell University)|2020. 04. 08.
Speech Recognition and Synthesis참고 문헌 29인용 수 9
한 줄 요약

이 논문은 병렬 학습 데이터와 동적 시간 비틀림(DTW)을 필요로 하지 않고 사이클 일관성 있는 적대적 학습을 통해 정서적 음성 변환(EVC)을 위한 CycleGAN 기반 접근법을 제안한다. 이 방법은 실제 음성과 생성된 음성을 구분하기 위한 두 개의 판별기와 정서 정체성을 유지하기 위한 분류기를 사용하며, 정렬 오류 없이 목적적 평가와 주관적 평가에서 경쟁적인 성능을 달성한다.

ABSTRACT

Emotional Voice Conversion, or emotional VC, is a technique of converting speech from one emotion state into another one, keeping the basic linguistic information and speaker identity. Previous approaches for emotional VC need parallel data and use dynamic time warping (DTW) method to temporally align the source-target speech parameters. These approaches often define a minimum generation loss as the objective function, such as L1 or L2 loss, to learn model parameters. Recently, cycle-consistent generative adversarial networks (CycleGAN) have been used successfully for non-parallel VC. This paper investigates the efficacy of using CycleGAN for emotional VC tasks. Rather than attempting to learn a mapping between parallel training data using a frame-to-frame minimum generation loss, the CycleGAN uses two discriminators and one classifier to guide the learning process, where the discriminators aim to differentiate between the natural and converted speech and the classifier aims to classify the underlying emotion from the natural and converted speech. The training process of the CycleGAN models randomly pairs source-target speech parameters, without any temporal alignment operation. The objective and subjective evaluation results confirm the effectiveness of using CycleGAN models for emotional VC. The non-parallel training for a CycleGAN indicates its potential for non-parallel emotional VC.

연구 동기 및 목표

  • 병렬 데이터에 의존하는 정서적 음성 변환(EVC) 방법의 한계를 해결하기 위해 동적 시간 비틀림(DTW)을 통한 정렬에 의존하는 것.
  • 최소 생성 손실(L1/L2 등) 대신 생성 적대적 학습을 도입하여 변환된 음성의 과도한 부드러움을 줄이고 자연스러움을 향상시키기 위해.
  • 비병렬 EVC의 가능성을 CycleGAN을 활용해 탐색하여, 정렬되지 않은 정서적 음성 데이터로도 영리하고 확장 가능한 학습이 가능하도록 하기 위해.
  • 목적적 지표(MCD, LogF0-MSE)와 정서 이행에 대한 주관적 인식을 포함한 CycleGAN 기반 EVC의 성능을 평가하기 위해.
  • 사이클 일관성과 정서 분류를 통한 적대적 학습이 변환 과정에서 언어적 내용과 정서 정체성을 효과적으로 유지할 수 있는지 검증하기 위해.

제안 방법

  • 원본 정서에서 목표 정서로의 매핑을 위한 하나의 생성기와 사이클 일관성을 확보하기 위한 역방향 생성기를 포함한 CycleGAN 프레임워크를 채택한다.
  • 실제 음성과 가짜 음성을 구분하기 위한 하나의 판별기와 변환된 음성이 청취자적 품질을 유지하도록 보장하기 위한 다른 판별기를 사용한다.
  • 실제 음성과 변환된 음성이 모두 정확하게 정서로 분류되도록 보장하기 위해 별도의 정서 분류기를 도입한다. 이를 통해 정서 정체성을 유지한다.
  • 프레임 수준의 정렬이 필요 없이, 적대적 손실, 사이클 일관성 손실, 분류 손실의 조합을 사용하여 모델을 학습한다.
  • 스펙트럼 특징과 F0 윤곽(웨이브릿 또는 로그 형태)을 입력으로 사용하며, 모델이 프로소디와 스펙트럼 차원을 종합적으로 학습하도록 한다.
  • 학습 중에 원본과 목표 음성을 무작위로 쌍지어 학습함으로써, 병렬 스크립트나 DTW 기반 정렬이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1비병렬 학습 데이터나 DTW 정렬이 없이도 CycleGAN 기반 학습이 경쟁적인 정서적 음성 변환 성능을 달성할 수 있는가?
  • RQ2최소 생성 손실(L1/L2 등)과 비교할 때, 적대적 손실은 음성의 자연스러움과 청취 품질 측면에서 어떤가?
  • RQ3목적적 지표와 주관적 인식을 통해 측정했을 때, CycleGAN은 변환 과정에서 정서 정체성을 어느 정도 유지할 수 있는가?
  • RQ4F0와 에너지 등의 프로소디 특징 학습을 포함한 스펙트럼 특징 학습의 조합이 단순한 F0 정규화보다 변환 품질을 향상시키는가?
  • RQ5주관적 평가에서 다양한 정서 쌍(예: 중립에서 슬픔, 중립에서 분노)에 대해 모델은 어떻게 성능을 내는가?

주요 결과

  • 동일한 특징 조합을 사용함에도 불구하고, CycleGAN 기반 모델은 최소 생성 손실을 사용하지 않음에도 불구하고 DBLSTM 기반 베이스라인보다 낮은 MCD(Mel-cepstral distortion)를 기록한다.
  • 중립에서 슬픔으로의 변환에 있어서, CycleGAN-2(스펙트럼 및 로그 형태의 F0 사용)는 슬픔으로 인식된 비율이 65.6%로 가장 높은 주관적 분류 정확도를 기록하여 다른 모델을 능가한다.
  • 중립에서 분노로의 변환에 있어서는 DBLSTM-1이 가장 낮은 MCD와 LF0-MSE를 기록하지만, CycleGAN-1은 그 성능의 94.2%를 달성하면서도 훨씬 더 자연스러운 음성 품질을 보였다.
  • 주관적 평가 결과, CycleGAN-2는 슬픔 변환에서 가장 높은 정확한 정서 분류 비율(65.6%)을 기록하여 강력한 청취자적 정렬을 보였다.
  • 비병렬 학습 덕분에 정렬 오류 없이 언어적 내용과 화자 정체성을 효과적으로 유지하면서 정서를 성공적으로 전달하였다.
  • 적대적 손실과 정서 분류기의 조합은 명시적인 프레임 수준 정렬 없이도 최소 생성 손실보다 더 자연스러운 음성 품질을 만들어내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.