Skip to main content
QUICK REVIEW

[논문 리뷰] VAW-GAN for Disentanglement and Recomposition of Emotional Elements in Speech

Kun Zhou, Berrak Şişman|arXiv (Cornell University)|2020. 11. 03.
Speech and Audio Processing인용 수 6
한 줄 요약

이 논문은 연속 파동수 변환(CWT)을 활용한 다중 척도의 억양 모델링과 F0 특징에 기반한 디코더 조건화를 통해 음성 내 감정 요소를 분리하고 재구성하는 VAW-GAN 기반의 발화자 종속 감정 음성 변환 프레임워크를 제안한다. 선형 F0 변환을 사용하는 기준 모델 대비 주관적 및 객관적 평가에서 더 뛰어난 음성 품질과 감정 유사도를 달성한다.

ABSTRACT

Emotional voice conversion (EVC) aims to convert the emotion of speech from one state to another while preserving the linguistic content and speaker identity. In this paper, we study the disentanglement and recomposition of emotional elements in speech through variational autoencoding Wasserstein generative adversarial network (VAW-GAN). We propose a speaker-dependent EVC framework based on VAW-GAN, that includes two VAW-GAN pipelines, one for spectrum conversion, and another for prosody conversion. We train a spectral encoder that disentangles emotion and prosody (F0) information from spectral features; we also train a prosodic encoder that disentangles emotion modulation of prosody (affective prosody) from linguistic prosody. At run-time, the decoder of spectral VAW-GAN is conditioned on the output of prosodic VAW-GAN. The vocoder takes the converted spectral and prosodic features to generate the target emotional speech. Experiments validate the effectiveness of our proposed method in both objective and subjective evaluations.

연구 동기 및 목표

  • 감정 음성 억양을 언어적 내용과 발화자 신원으로부터 분리하는 문제를 해결하기 위해.
  • 비병렬 자료 기반의 발화자 종속 EVC 프레임워크를 개발하여 다대다 감정 전이를 가능하게 하기 위해.
  • 연속 파동수 변환(CWT)을 사용해 F0를 다중 시간 척도에서 표현함으로써 억양 모델링을 향상시키기 위해.
  • 디코더에서 F0 조건화를 통해 감정 전이 성능을 향상시키기 위해.
  • 객관적 및 주관적 평가를 통해 제안된 방법의 유효성을 검증하기 위해.

제안 방법

  • 프레임워크는 스펙트럼 특징 변환과 억양 특징 변환을 위한 두 개의 VAW-GAN 파이프라인을 사용한다.
  • 스펙트럼 인코더는 VAW-GAN를 활용해 스펙트럼 특징으로부터 감정과 억양(F0) 정보를 분리한다.
  • 억양 인코더는 CWT 분해된 F0 특징을 사용해 언어적 억양에서 정서적 억양(감정 조절)을 분리한다.
  • 스펙트럼 VAW-GAN의 디코더는 억양 VAW-GAN의 출력에 조건을 줘서 목표 감정 음성을 생성한다.
  • F0에 CWT를 적용하여 다중 시간 척도에서 억양을 모델링함으로써 감정 억양의 표현력을 향상시킨다.
  • 보코더는 변환된 스펙트럼 및 억양 특징에서 최종 음성을 복원하며, F0 조건화가 복원 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1VAW-GAN는 비병렬 음성 자료에서 언어적 억양과 발화자 신원으로부터 감정 억양을 효과적으로 분리할 수 있는가?
  • RQ2선형 F0 변환 대비 CWT 기반의 F0 표현은 억양 모델링과 감정 음성 변환 성능을 향상시키는가?
  • RQ3스펙트럼 디코더를 F0 특징에 조건화하는 것은 변환된 음성의 음성 품질과 감정 유사도에 어떤 영향을 미치는가?
  • RQ4제안된 프레임워크는 병렬 자료 없이 기준 EVC 방법보다 더 뛰어난 주관적 및 객관적 성능을 달성할 수 있는가?
  • RQ5CWT를 통한 다중 척도 억양 모델링은 발화자 종속 음성 변환에서 감정 전이에 얼마나 기여하는가?

주요 결과

  • 제안된 VAW-GAN(SP+CWT+C) 프레임워크는 F0 모델링 향상으로 인해 기준 VAW-GAN(SP+F0+C) 대비 prosody conversion의 RMSE 및 PCC 지표에서 유의미하게 뛰어난 성능을 보였다.
  • F0 특징에 의한 디코더 조건화는 XAB 테스트 결과에서 제안된 프레임워크가 비조건화 기준 모델보다 일관되게 선호됨을 확인함으로써 더 나은 음성 품질을 유도했다.
  • XAB 청취 테스트에서 제안된 프레임워크는 특히 N2A(중립에서 분노) 변환에서 기준 모델보다 뛰어난 감정 유사도 성능을 보였다.
  • 기존의 LG 기반 선형 F0 변환 대비 CWT를 활용한 F0 표현은 복잡한 감정 전이(예: N2A)에서 유의미하게 더 뛰어난 감정 성능을 달성했다.
  • 주관적 평가 결과, 제안된 방법은 더 자연스럽고 감정적으로 표현력 있는 음성을 생성하며, 음질과 감정 진실성 모두에서 청취자 선호도가 높았다.
  • 비병렬 훈련 자료만을 사용함에도 불구하고, 제안된 프레임워크는 발화자 종속 감정 음성 변환에서 감정 요소의 분리 및 재구성에 있어 뛰어난 성능을 보였으며, 이는 그 유효성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.