Skip to main content
QUICK REVIEW

[논문 리뷰] Seen and Unseen emotional style transfer for voice conversion with a new emotional speech dataset

Kun Zhou, Berrak Şişman|arXiv (Cornell University)|2020. 10. 28.
Speech Recognition and Synthesis참고 문헌 36인용 수 14
한 줄 요약

이 논문은 사전 훈련된 음성 감정 인식(SER) 모델에서 유도한 깊이 있는 감정 특징을 조건으로 삼는 VAW-GAN 아키텍처를 사용하여, 평행 훈련 데이터가 없이도 알려진 감정과 알려지지 않은 감정 모두를 위한 일대다 감정 스타일 전이(EST) 프레임워크를 제안한다. 이 방법은 스펙트럼 및 청각적 지표에서 최신 기술 수준의 성능을 달성하며, 커뮤니티 사용을 위해 새로운 다중 화자, 다중 언어 감정 음성 데이터셋(ESD)을 공개한다.

ABSTRACT

Emotional voice conversion aims to transform emotional prosody in speech while preserving the linguistic content and speaker identity. Prior studies show that it is possible to disentangle emotional prosody using an encoder-decoder network conditioned on discrete representation, such as one-hot emotion labels. Such networks learn to remember a fixed set of emotional styles. In this paper, we propose a novel framework based on variational auto-encoding Wasserstein generative adversarial network (VAW-GAN), which makes use of a pre-trained speech emotion recognition (SER) model to transfer emotional style during training and at run-time inference. In this way, the network is able to transfer both seen and unseen emotional style to a new utterance. We show that the proposed framework achieves remarkable performance by consistently outperforming the baseline framework. This paper also marks the release of an emotional speech dataset (ESD) for voice conversion, which has multiple speakers and languages.

연구 동기 및 목표

  • 평행 훈련 데이터가 필요 없이 일대다 감정 음성 변환을 가능하게 하기 위해.
  • 이산 레이블 대신 연속적인 깊이 있는 감정 특징을 사용하여 알려진 및 알려지지 않은 감정 스타일 전이를 지원하기 위해.
  • 연속 잠재 공간에서 감정의 프로소디를 분리함으로써 감정 음성 변환의 일반화 성능을 향상시키기 위해.
  • 음성 변환 연구를 위한 오픈소스로 사용 가능한 다중 화자, 다중 언어 감정 음성 데이터셋의 부족을 해소하기 위해.
  • 음성 변환 및 표현력 있는 TTS 분야에서 광범위하게 활용할 수 있도록 새로운 감정 음성 데이터셋(ESD)을 공개하기 위해.

제안 방법

  • 프레임워크는 조건부 생성자와 판별자를 갖춘 VAW-GAN 아키텍처를 사용하며, 디코더는 사전 훈련된 SER 모델에서 유도한 깊이 있는 감정 특징에 조건을 받는다.
  • 에코더는 입력 음성을 128차원 잠재 벡터 $ z $로 매핑하며, 이는 256차원 깊이 있는 감정 특징 벡터와 1차원 F0 윤곽과 연결된다.
  • 깊이 있는 감정 특징 벡터는 사전 훈련된 SER 모델에서 추출되며, 감정 스타일 전이의 연속 제어 신호로 기능한다.
  • 생성자는 커널 크기가 {9,7,7,1025}이고 스트라이드가 {3,3,3,1}인 4층의 1차원 CNN을 사용하며, 판별자는 커널 크기가 {7,7,115}이고 스트라이드가 {3,3,3}인 3층의 1차원 CNN을 사용한다.
  • 모델는 RMSProp을 사용하여 학습률 1e-5, 배치 크기 256로 45 에포크 동안 훈련된다.
  • 프레임워크는 평행 데이터 없이 엔드 투 엔드 훈련이 가능하며, 하나의 모델로 모든 감정 변환 쌍을 수행할 수 있다.

실험 결과

연구 질문

  • RQ1일관된 평행 훈련 데이터 없이도 단일 모델이 알려진 감정과 알려지지 않은 감정 스타일 모두를 음성 변환에서 일반화하여 전이할 수 있는가?
  • RQ2사전 훈련된 SER 모델에서 유도한 깊이 있는 감정 특징이 연속 잠재 공간에서 감정 프로소디를 효과적으로 표현하고 제어할 수 있는가?
  • RQ3제안된 프레임워크는 알려진 감정과 알려지지 않은 감정 모두에 대해 스펙트럼 왜곡과 청각적 품질 측면에서 기준 모델 대비 어떻게 성능을 냈는가?
  • RQ4이산 감정 레이블 대비 연속 깊이 있는 감정 특징의 사용이 일반화 성능 향상에 얼마나 기여하는가?
  • RQ5감정 스타일 전이 과정에서 언어적 내용과 화자 정체성을 얼마나 효과적으로 유지하는가?

주요 결과

  • 제안된 DeepEST 프레임워크는 모든 알려진 감정 조합(N2H 및 N2S)에서 기준 VAW-GAN-EVC 대비 멜-세프트럴 왜곡(MCD)에서 우수한 성능을 보였다.
  • 알려지지 않은 감정(화남)에 대해서도 DeepEST는 특정로 화남 샘플에 대해 훈련된 기준 모델과 유사한 MCD 결과를 달성하여, 알려지지 않은 스타일로의 일반화 능력을 입증했다.
  • 주관적 听음 테스트에서 DeepEST는 알려진 감정 조합과 알려지지 않은 감정 조합 모두에서 기준 모델보다 높은 평균 의견 점수(MOS)를 기록했다.
  • AB 선호도 테스트에서 DeepEST는 모든 감정 쌍에서 음성 품질 측면에서 기준 모델에 비해 일관되게 뛰어난 성능을 보였다.
  • XAB 감정 유사도 테스트 결과, DeepEST는 기준 모델이 특정 감정(예: 화남)에 대해 훈련된 경우와 유사하게 감정 유사도를 유지했으며, 특히 알려지지 않은 감정(예: 화남)에 대해서도 유사도가 높게 유지됨을 확인했다.
  • 기준 모델이 각 쌍에 대해 별도의 3개 모델이 필요로 하는 것에 비해, 이 프레임워크는 모든 감정 변환 쌍에 대해 단일 모델만으로도 가능하므로 효율성과 확장성 측면에서 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.