[논문 리뷰] Converting Anyone's Emotion: Towards Speaker-Independent Emotional Voice Conversion
이 논문은 병렬 훈련 데이터가 필요하지 않은 VAW-GAN 기반 인코더-디코더 아키텍처를 사용하여 화자 독립적 감정 음성 변환 프레임워크를 제안한다. 연속 웨이블릿 변환(CWT)을 활용해 억양을 모델링하고, 디코더를 CWT 기반의 F0 특징에 조건화시킴으로써, 볼 수 있는 화자와 볼 수 없는 화자 모두에서 고품질의 화자 유지 감정 변환을 달성한다. 감정 유사도 측면에서 화자에 종속된 기준 모델을 능가하면서도 화자 신원을 유지한다.
Emotional voice conversion aims to convert the emotion of speech from one state to another while preserving the linguistic content and speaker identity. The prior studies on emotional voice conversion are mostly carried out under the assumption that emotion is speaker-dependent. We consider that there is a common code between speakers for emotional expression in a spoken language, therefore, a speaker-independent mapping between emotional states is possible. In this paper, we propose a speaker-independent emotional voice conversion framework, that can convert anyone's emotion without the need for parallel data. We propose a VAW-GAN based encoder-decoder structure to learn the spectrum and prosody mapping. We perform prosody conversion by using continuous wavelet transform (CWT) to model the temporal dependencies. We also investigate the use of F0 as an additional input to the decoder to improve emotion conversion performance. Experiments show that the proposed speaker-independent framework achieves competitive results for both seen and unseen speakers.
연구 동기 및 목표
- 음성에서 감정 표현이 화자에 독립적인 패턴을 포함하고 있는지 여부를 조사하는 것.
- 병렬 훈련 데이터가 필요하지 않은 화자 독립 감정 음성 변환 프레임워크를 개발하는 것.
- 연속 웨이블릿 변환(CWT)을 사용하여 음고의 시간적 의존성을 파악함으로써 감정 음성 변환의 억양 모델링을 향상시키는 것.
- CWT 기반 F0 특징에 디코더를 조건화시켜 스펙트럼 및 억양 변환 성능을 향상시키는 것.
- 화자에 종속된 훈련에 비해 화자에 독립된 훈련이 더 잘 일반화됨을 검증하는 것.
제안 방법
- 프레임워크는 스펙트럼 및 억양 특징의 감정 상태 간에 화자에 독립적인 매핑을 학습하기 위해 VAW-GAN 기반의 인코더-디코더 아키텍처를 사용한다.
- 억양은 연속 웨이블릿 변환(CWT)을 사용하여 다중 시간-주파수 해상도에서 음고 흐름을 표현함으로써 계층적이고 초세그먼탈 감정 신호를 포착한다.
- 디코더는 감정 변환 중 스펙트럼 복원 정확도를 향상시키기 위해 CWT 변환된 F0 특징에 조건화된다.
- 모델은 사이클-일致성 있는 적대적 손실을 사용하여 엔드 투 엔드로 훈련되며, 병렬 훈련 데이터가 필요 없게 된다.
- 다양한 화자를 포함한 다중 화자 데이터셋을 사용하여 볼 수 있는 화자와 볼 수 없는 화자 모두에 대해 화자에 독립적인 일반화를 위해 훈련된다.
- 감정 충실도와 화자 유지 정도를 평가하기 위해 MOS, XAB 감정 유사도 및 XAB 화자 유사도 테스트를 통해 프레임워크를 평가한다.
실험 결과
연구 질문
- RQ1음성에서 감정 표현을 화자에 독립적인 방식으로 모델링할 수 있는가? 이는 병렬 데이터 없이도 다른 화자 간 변환을 가능하게 한다.
- RQ2CWT 변환된 F0에 디코더를 조건화시키는 것이 감정 음성 변환의 품질을 향상시키는가?
- RQ3감정 유사도 및 화자 신원 유지 측면에서 화자에 독립된 훈련은 화자에 종속된 훈련보다 어떻게 다를까?
- RQ4제안된 프레임워크는 높은 감정 충실도와 화자 신원 유지 조건에서 볼 수 없는 화자에게도 일반화 가능한가?
- RQ5비병렬, 다중 화자 데이터만으로도 고품질 감정 음성 변환을 달성할 수 있는가?
주요 결과
- CWT-C-VAWGAN 프레임워크는 평균 관점 평가 점수(MOS)가 2.808 ± 0.137을 기록하여 CWT-VAWGAN(2.731 ± 0.163)보다 유의미하게 높게 나타나, F0 조건화의 유용성을 확인한다.
- XAB 감정 유사도 테스트에서 화자에 독립된 훈련이 볼 수 있는 화자와 볼 수 없는 화자 모두에서 화자에 종속된 훈련을 능가했으며, 청취자들은 볼 수 없는 화자에 대해 화자에 독립된 접근 방식을 더 선호했다.
- 제안된 CWT-C-VAWGAN 프레임워크는 화자에 종속된 기준 모델(SD-CWT-C-VAWGAN)과 유사한 화자 유사도를 기록하여 감정 변환 과정에서 화자 신원이 손상되지 않음을 시사한다.
- XAB 테스트는 화자에 독립된 모델이 볼 수 없는 화자에게 효과적으로 일반화됨을 확인했으며, 강건성과 일반화 능력이 뛰어나다는 것을 입증한다.
- 결과는 화자에 독립적인 감정 음성 변환이 병렬 데이터 없이도 가능하고 효과적이라는 것을 검증한다.
- 본 연구는 처음으로, 단일 통합 모델을 사용하여 볼 수 있는 화자와 볼 수 없는 화자 모두에서 경쟁적인 성능을 달성할 수 있는 화자에 독립적인 감정 음성 변환 프레임워크의 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.