Skip to main content
QUICK REVIEW

[논문 리뷰] Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training

Kun Zhou, Berrak Şişman|arXiv (Cornell University)|2021. 03. 31.
Speech Recognition and Synthesis참고 문헌 38인용 수 4
한 줄 요약

이 논문은 데이터 부족 문제를 해결하기 위해 텍스트-to-음성(TTS) 미사전학습을 활용하는 이중 단계 시퀀스-투-시퀀스(seq2seq) 프레임워크를 제안한다. 먼저 다중 화자 TTS를 통해 스타일 분리 기반 초기화를 수행한 후, 제한된 감정 음성 데이터로 미세조정함으로써, 스펙트럼 및 프로소디 변환 측면에서 최신 기술(SOTA) 성능을 달성하며, 최소한의 레이블 데이터로도 객관적이고 주관적인 평가에서 기존 기준 모델들을 크게 앞서는 성능을 보였다.

ABSTRACT

Emotional voice conversion (EVC) aims to change the emotional state of an utterance while preserving the linguistic content and speaker identity. In this paper, we propose a novel 2-stage training strategy for sequence-to-sequence emotional voice conversion with a limited amount of emotional speech data. We note that the proposed EVC framework leverages text-to-speech (TTS) as they share a common goal that is to generate high-quality expressive voice. In stage 1, we perform style initialization with a multi-speaker TTS corpus, to disentangle speaking style and linguistic content. In stage 2, we perform emotion training with a limited amount of emotional speech data, to learn how to disentangle emotional style and linguistic information from the speech. The proposed framework can perform both spectrum and prosody conversion and achieves significant improvement over the state-of-the-art baselines in both objective and subjective evaluation.

연구 동기 및 목표

  • 제한된 감정 음성 데이터로 고품질 감정 음성 변환(EVC) 시스템을 훈련하는 데 도전하는 것.
  • TTS와 EVC가 모두 표현적 음성 생성을 공유하는 목표를 활용하여 모델의 일반화 및 분리 능력을 향상시키는 것.
  • 병렬 훈련 데이터가 필요 없이 다수의 감정 간 상호 변환을 가능하게 하는 것.
  • 주의 메커니즘을 통해 프레임 단위에서 시퀀스 수준의 정렬로 전환하여 프로소디 및 지속 시간 모델링을 향상시키는 것.
  • 제한된 감정 음성 데이터만으로 WaveRNN 음성 생성기의 감정 특화 미세조정을 통해 음질을 향상시키는 것.

제안 방법

  • 단계 1: 다중 화자 TTS 코퍼스를 사용하여 언어적 내용과 발화 스타일을 분리하는 스타일 초기화 수행.
  • 단계 2: 제한된 감정 음성 데이터로 전체 모델을 미세조정하여 감정 특화 스타일 분리 능력을 학습.
  • 언어적 공간에서 감정 관련 정보를 억제하기 위해 감정 인코더와 분류기를 통합.
  • 주의 기반 seq2seq 아키텍처를 사용하여 청각적 및 언어적 임베딩 간의 정렬을 모델링하고 계층적 프로소디 모델링을 구현.
  • 제한된 감정 음성 데이터만으로 WaveRNN 음성 생성기를 감정 특화로 미세조정하여 청취자적 품질을 향상시킴.
  • 시퀀스 수준의 감독 신호를 사용하여 스펙트럼 및 지속 시간 변환을 종합 최적화하는 엔드 투 엔드 훈련 수행.
Figure 1: Visualization of emotion embeddings derived from (a) style encoder and (b) emotion encoder. Each point represents the emotion embedding of a reference utterance.
Figure 1: Visualization of emotion embeddings derived from (a) style encoder and (b) emotion encoder. Each point represents the emotion embedding of a reference utterance.

실험 결과

연구 질문

  • RQ1이중 단계 훈련 전략은 seq2seq 감정 음성 변환에서 데이터 의존도를 줄일 수 있는가?
  • RQ2TTS 미사전학습은 낮은 데이터 환경에서 언어적 내용과 감정 및 화자 스타일을 효과적으로 분리할 수 있는가?
  • RQ3시퀀스 수준의 주의 메커니즘 모델링은 フ레임 단위 방법에 비해 프로소디 및 지속 시간 변환 성능을 향상시키는가?
  • RQ4WaveRNN 음성 생성기의 감정 특화 미세조정은 최소한의 데이터로도 청취자적 품질을 향상시킬 수 있는가?
  • RQ5제안된 프레임워크는 객관적 지표와 주관적 청취 테스트 모두에서 최신 기술 기준 모델들과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 Seq2seq-EVC-WA1 및 Seq2seq-EVC-WA2 모델은 모든 감정 쌍에서 가장 낮은 MCD 값을 기록하며, CycleGAN-EVC 및 StarGAN-EVC를 뛰어넘는 성능을 보였다.
  • WaveRNN를 미세조정한 모델들(Sys2seq-EVC-WA2)은 DDUR 결과에서 최고 성능을 기록하여 지속 시간 변환 능력이 뛰어남을 입증했다.
  • 주관적 청취 테스트 결과, Seq2seq-EVC-WA2는 Neu-Sad 감정 쌍에서 90%의 청취자에게 음성 품질 측면에서 최고로 평가받았다.
  • 감정 유사도 점수는 Seq2seq-EVC-WA2가 기준 모델들보다 뚜렷이 뛰어나며, 특히 Neu-Sur 쌍에서 평균 점수로 +1.8(−2에서 +2 척도)를 기록했다.
  • 주의 메커니즘이 다양한 발음 지속 시간 매핑을 가능하게 하였으며, 정렬 시각화 결과 동일한 원천 문장이 기쁨과 슬픔 타겟에 대해 서로 다른 지속 시간을 생성하는 것으로 확인되었다.
  • 감정 특화로 WaveRNN 음성 생성기를 미세조정함으로써 청취자적 품질 향상이 일관되게 이루어졌으며, 이는 최고-최악 스케일링(BWS) 결과로도 확인되었다.
Figure 2: The proposed 2-stage training strategy for seq2seq emotional voice conversion with limited emotional speech data.
Figure 2: The proposed 2-stage training strategy for seq2seq emotional voice conversion with limited emotional speech data.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.