Skip to main content
QUICK REVIEW

[논문 리뷰] Emotional Voice Conversion: Theory, Databases and ESD

Kun Zhou, Berrak Şişman|arXiv (Cornell University)|2021. 05. 31.
Speech Recognition and Synthesis참고 문헌 131인용 수 8
한 줄 요약

이 논문은 350개의 병렬 발화를 포함한 공개된 다중 화자, 다국어 음성 데이터베이스인 정서 음성 데이터베이스(ESD)를 소개한다. 이 데이터베이스는 영어 10명, 중국어 10명의 화자들이 5가지 정서(중립, 기쁨, 분노, 슬픔, 놀람)에서 기록한 것으로, 총 29시간 이상의 고품질 음성으로 구성되어 있다. 저자들은 최신 정서 기반 음성 변환 시스템을 구현하여 데이터베이스의 유효성을 검증하였으며, 이는 정서 인식 음성 합성 및 음성 변환 분야의 연구 발전에 기여하고 있음을 보여준다.

ABSTRACT

In this paper, we first provide a review of the state-of-the-art emotional voice conversion research, and the existing emotional speech databases. We then motivate the development of a novel emotional speech database (ESD) that addresses the increasing research need. With this paper, the ESD database is now made available to the research community. The ESD database consists of 350 parallel utterances spoken by 10 native English and 10 native Chinese speakers and covers 5 emotion categories (neutral, happy, angry, sad and surprise). More than 29 hours of speech data were recorded in a controlled acoustic environment. The database is suitable for multi-speaker and cross-lingual emotional voice conversion studies. As case studies, we implement several state-of-the-art emotional voice conversion systems on the ESD database. This paper provides a reference study on ESD in conjunction with its release.

연구 동기 및 목표

  • 다양한 화자 및 다국어 정서 기반 음성 변환 연구에 적합한 공개된 고품질 정서 음성 데이터베이스의 부족을 해결하기 위해.
  • 기존의 정서 기반 음성 변환 기법과 데이터베이스에 대한 종합적인 검토를 제공하기 위해.
  • 연구 공동체를 위한 벤치마크 자원으로 ESD 데이터베이스를 공개하기 위해.
  • 최신 정서 기반 음성 변환 모델을 사용한 사례 연구를 통해 ESD의 유효성을 입증하기 위해.
  • 인간-기계 상호작용에서 정서 지능을 갖춘 음성 합성 시스템 개발을 지원하기 위해.

제안 방법

  • ESD 데이터베이스는 제어된 음향 환경에서 영어 모국어 10명, 중국어 모국어 10명의 화자들로부터 수집되었다.
  • 각 화자는 5가지 정서 유형 각각에 대해 35개의 발화를 기록하여 총 350개의 병렬 발화가 생성되었다.
  • 데이터베이스는 언어적 내용을 유지하고 화자 신원을 그대로 보존한 고해상도 음성 기록을 포함하고 있다.
  • 저자들은 GAN 기반, 시퀀스-투-시퀀스, 오토에인코더 기반 프레임워크를 포함한 최신 정서 기반 음성 변환 모델을 ESD 데이터셋에 적용하였다.
  • 평가 프레임워크는 일반화 능력과 강건성을 평가하기 위해 화자 종속 및 다국어 설정을 모두 포함하고 있다.
  • 이 연구는 ESD 데이터셋을 활용하여 정서 기반 음성 변환 및 정서 기반 텍스트 음성 변환 응용을 위한 모델을 훈련하고 검증하였다.

실험 결과

연구 질문

  • RQ1대규모 다중 화자 다국어 정서 음성 데이터베이스는 정서 기반 음성 변환 시스템의 성능과 일반화 능력을 어떻게 향상시킬 수 있는가?
  • RQ2음성 변환에서 초음절적 정서적 억양과 스펙트럼 역학을 모델링할 때의 주요 과제는 무엇인가?
  • RQ3ESD 데이터베이스는 최신 정서 기반 음성 변환 및 텍스트 음성 변환 프레임워크 지원에 얼마나 효과적인가?
  • RQ4ESD에서 훈련된 엔드 투 엔드 모델은 다양한 언어와 화자 신원 간에 일반화될 수 있는가?
  • RQ5분리 표현 학습은 정서 기반 음성 변환 품질 향상에 어떤 역할을 하는가?

주요 결과

  • ESD 데이터베이스는 20명의 화자들 사이에서 29시간 이상의 고품질 병렬 기록을 포함한 공개된 정서 음성 데이터베이스 중 가장 큰 편에 속한다.
  • 이 데이터베이스는 화자 종속 및 다국어 정서 기반 음성 변환을 모두 지원하여 다양한 연구 응용 가능성을 제공한다.
  • 사례 연구를 통해 GAN 기반 및 시퀀스-투-시퀀스 프레임워크를 포함한 최신 모델들이 ESD에서 높은 품질의 정서 기반 음성 변환을 달성하고 있음을 입증하였다.
  • ESD 데이터베이스를 통해 정서 표현력이 뛰어난 정서 기반 텍스트 음성 변환 시스템의 성공적인 훈련이 가능해졌으며, 보고된 프레임워크들은 높은 성능을 기록하였다.
  • ESD의 공개는 재현 가능한 연구와 다양한 정서 기반 음성 변환 방법 간 비교를 촉진하는 표준화된 벤치마크를 제공한다.
  • 이미 후속 연구에서 데이터베이스가 사용되어 그 유효성과 신뢰성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.