Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Target Emotional Voice Conversion With Neural Vocoders

Songxiang Liu, Yuewen Cao|arXiv (Cornell University)|2020. 04. 08.
Speech Recognition and Synthesis참고 문헌 34인용 수 11
한 줄 요약

이 논문은 신경 음성합성기와 함께 깊이 있는 양방향 LSTM(DBLSTM) 변환 모델을 사용한 다중 대상 정서 음성 변환(MTEVC) 시스템을 제안한다. 음소 후행도그램(PPGs)을 도입하여 언어 모델링을 향상시켰으며, 유연성 기반 신경 음성합성기인 FloWaveNet을 사용하여 상태의 최고 성능을 달성하였다. 이는 여러 정서 쌍에 걸쳐 스펙트럼 및 피치 변환 지표에서 기존의 Griffin-Lim 및 자동회귀형 WaveNet을 모두 능가하였다.

ABSTRACT

Emotional voice conversion (EVC) is one way to generate expressive synthetic speech. Previous approaches mainly focused on modeling one-to-one mapping, i.e., conversion from one emotional state to another emotional state, with Mel-cepstral vocoders. In this paper, we investigate building a multi-target EVC (MTEVC) architecture, which combines a deep bidirectional long-short term memory (DBLSTM)-based conversion model and a neural vocoder. Phonetic posteriorgrams (PPGs) containing rich linguistic information are incorporated into the conversion model as auxiliary input features, which boost the conversion performance. To leverage the advantages of the newly emerged neural vocoders, we investigate the conditional WaveNet and flow-based WaveNet (FloWaveNet) as speech generators. The vocoders take in additional speaker information and emotion information as auxiliary features and are trained with a multi-speaker and multi-emotion speech corpus. Objective metrics and subjective evaluation of the experimental results verify the efficacy of the proposed MTEVC architecture for EVC.

연구 동기 및 목표

  • 일대일 정서 음성 변환(EVC)의 한계를 해결하기 위해 단일 모델로 다중 대상 EVC를 가능하게 하기 위해.
  • 전통적인 멜-세프스트럼 음성합성기를 신경 음성합성기로 대체하여 음성의 자연스러움과 변환 정확도를 향상시키기 위해.
  • 말하기자립형 음소 후행도그램(PPGs)을 보조 특징으로 도입하여 EVC에서 언어 모델링을 향상시키기 위해.
  • 다중 화자 및 다중 정서 데이터를 기반으로 화자 및 정서 코드를 통한 신경 음성합성기를 훈련시켜 보다 일반화된 성능을 확보하기 위해.
  • 객관적 지표와 주관적 听음 테스트를 모두 활용하여 제안된 MTEVC 프레임워크의 성능을 평가하기 위해.

제안 방법

  • DBLSTM 기반의 변환 모델은 원천 멜 스펙트로그램과 PPGs를 입력으로 하며, 목표 정서 상태를 제어하기 위해 원-핫 보조 특징으로 정서 코드를 사용한다.
  • 시스템은 조건부 WaveNet과 흐름 기반 WaveNet(FloWaveNet)을 신경 음성합성기로 사용하며, 멜 스펙트로그램에 조건을 주고 화자 및 정서 코드를 통합한다.
  • PPGs는 화자 독립형 음성인식 시스템에서 추출되어, 평행 훈련 데이터가 필요 없이도 강건한 언어적 맥락을 제공한다.
  • 신경 음성합성기는 다중 화자 및 다중 정서 코퍼스를 기반으로 훈련되어 화자 및 정서에 따라 달라지는 음성 특징을 학습한다.
  • FloWaveNet에 대해 최대우도 손실을 사용한 엔드 투 엔드 훈련과 WaveNet에 대해 자동회귀적 생성 방식을 적용한다.
  • 정서 코드는 변환 모델과 음성합성기 양쪽 모두를 조건화하여 다중 대상 변환의 유연성을 확보한다.

실험 결과

연구 질문

  • RQ1각 쌍에 대해 별도의 모델이 필요 없이 단일 MTEVC 모델이 여러 정서 상태에 일반화될 수 있는가?
  • RQ2보조 특징으로 PPGs를 도입함으로써 DBLSTM 기반의 변환 모델이 스펙트럼 및 피치 변환 성능에 향상이 이루어지는가?
  • RQ3WaveNet 및 FloWaveNet과 같은 신경 음성합성기가 전통적인 멜-세프스트럼 음성합성기와 비교해 스펙트럼 및 억양의 정밀도에서 어떤가?
  • RQ4다중 화자 및 다중 정서 데이터를 기반으로 신경 음성합성기를 훈련시킬 경우, 공유 파rameter를 통해 고음질의 정서 특화 음성 합성을 가능하게 할 수 있는가?
  • RQ5WaveNet과 FloWaveNet 중 어느 신경 음성합성기가 다중 대상 EVC에서 품질, 속도, 일반화 능력의 최적의 균형을 제공하는가?

주요 결과

  • FloWaveNet은 모든 정서 쌍에서 가장 낮은 MCD(8.05–8.84)를 기록하여, WaveNet과 Griffin-Lim을 모두 능가한 스펙트럼 변환 성능을 보였다.
  • PPGs를 보조 입력으로 사용한 제안된 모델은 PPGs 없이 사용한 베이스라인 대비 최대 1.5 dB 감소한 MCD를 기록하여 스펙트럼 재구성 향상을 입증하였다.
  • 피치 변환에서는 제안된 모델이 가장 낮은 LogF0-MSE(1.05–2.74)를 기록하였으며, 중립에서 슬픔, 중립에서 분노로의 변환에서 가장 우수한 성능을 보였다.
  • 주관적 평가 결과, P-WaveNet은 중립에서 기쁨으로의 변환에서 86.7%의 정확도를 기록하였고, P-FloWaveNet은 중립에서 슬픔으로의 변환에서 80.1%의 정확도를 기록하여 강력한 정서 전달 정확도를 입증하였다.
  • B-FloWaveNet 모델은 중립에서 슬픔으로의 변환에서 38.9%의 정확도를 기록하였으며, 이는 FloWaveNet을 사용한 베이스라인 모델이 다른 모델보다도 정서 인식에서 뛰어난 성능을 보임을 시사한다.
  • 음성합성기 내 화자 및 정서 코드의 사용은 다수의 화자와 정서에 걸쳐 공통된 모델을 사용하여 고음질의 정서 특화 음성 생성을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.