[논문 리뷰] Transforming Spectrum and Prosody for Emotional Voice Conversion with Non-Parallel Training Data
이 논문은 병렬 데이터가 없는 조건에서 스펙트럼 및 억양 변환을 위한 CycleGAN 기반의 비병렬 정서 음성 변환 프레임워크를 제안하며, F0는 다중 시간 척도에서 연속 웨이블릿 변환(CWT)을 통해 모델링된다. 이 방법은 기준 모델 대비 뛰어난 정서 유사성을 달성하며, 특히 스펙트럼과 억양을 별도로 훈련시킴으로써 93.6%와 96.5%의 XAB 테스트에서 중성에서 분노로, 중성에서 놀라움으로의 변환에서 우수한 성능을 보인다.
Emotional voice conversion aims to convert the spectrum and prosody to change the emotional patterns of speech, while preserving the speaker identity and linguistic content. Many studies require parallel speech data between different emotional patterns, which is not practical in real life. Moreover, they often model the conversion of fundamental frequency (F0) with a simple linear transform. As F0 is a key aspect of intonation that is hierarchical in nature, we believe that it is more adequate to model F0 in different temporal scales by using wavelet transform. We propose a CycleGAN network to find an optimal pseudo pair from non-parallel training data by learning forward and inverse mappings simultaneously using adversarial and cycle-consistency losses. We also study the use of continuous wavelet transform (CWT) to decompose F0 into ten temporal scales, that describes speech prosody at different time resolution, for effective F0 conversion. Experimental results show that our proposed framework outperforms the baselines both in objective and subjective evaluations.
연구 동기 및 목표
- 음성 변환을 위한 병렬 정서 음성 데이터 수집이 비현실적이라는 문제를 해결하기 위해.
- 단일 척도 F0 표현을 초월하여 억양을 모델링하여 정서 음성 변환을 향상시키기 위해.
- 스펙트럼과 양음의 별도 훈련 또는 통합 훈련 중 어느 것이 더 뛰어난 정서 유사성을 제공하는지 조사하기 위해.
- 연속 웨이블릿 변환(CWT)을 사용해 F0를 계층적인 시간 척도로 분해함으로써 F0 변환을 향상시키기 위해.
- 대부분의 병렬 데이터 없이도 고품질의 정서 음성 변환 시스템을 개발하기 위해, 적대적 손실과 사이클 일致성 손실을 활용하기 위해.
제안 방법
- 병렬 데이터 없이도 원천 및 목표 정서 음성 간의 이중 방향 매핑을 학습하기 위해 CycleGAN을 활용하며, 적대적 손실과 사이클 일치 손실을 사용한다.
- 기본 주파수(F0)를 10개의 시간 척도로 분해하기 위해 연속 웨이블릿 변환(CWT)을 적용하여 다중 해상도 억양 모델링을 수행한다.
- 스펙트럼 변환과 F0 변환(=CWT 계수를 통한)을 별도로 훈련함으로써 제한된 데이터 상황에서의 일반화 능력을 향상시킨다.
- 변환된 음성과 기준 타겟 간의 정서 유사성을 평가하기 위해 XAB 청취 테스트를 활용한다.
- 동일한 화자에서 다양한 정서로 구성된 병렬 예제 없이도 훈련 데이터로 비병렬 문장들을 사용한다.
- 스펙트럼 특징에서 F0 변환을 분리함으로써 억양을 콘텐츠 독립적으로 모델링함으로써, 새로운 언어적 콘텐츠에 대한 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1병렬 훈련 데이터가 필요 없이도 CycleGAN 기반 프레임워크가 효과적인 정서 음성 변환을 달성할 수 있는가?
- RQ2다중 시간 척도에서 연속 웨이블릿 변환(CWT)을 사용해 F0를 모델링함으로써 정서 억양 변환 성능이 향상되는가?
- RQ3스펙트럼과 억양 변환을 별도로 훈련하는 것이 통합 훈련 대비 정서 유사성 측면에서 더 우수한가?
- RQ4제안된 방법은 목적적 평가와 주관적 평가 모두에서 기준 모델과 비교해 어떻게 성능을 내는가?
- RQ5이 프레임워크는 정서 표현을 변환하는 동안 화자 정체성과 언어적 콘텐츠를 유지할 수 있는가?
주요 결과
- 제안된 CycleGAN-Separate 프레임워크는 목적적 평가와 주관적 평가에서 기준 모델을 초월하며, 중성에서 분노로의 변환에서 XAB 테스트에서 93.6%의 선호도를 기록했다.
- CycleGAN-Separate 방법은 중성에서 놀라움으로의 변환에서 XAB 테스트에서 96.5%의 선호도를 기록하여 뛰어난 정서 유사성을 입증했다.
- 스펙트럼과 억양의 별도 훈련이 통합 훈련보다 뚜렷이 우수한 성능을 보였으며, 데이터가 제한된 상황에서 억양을 별도로 모델링하는 것이 더 효과적임을 시사한다.
- CWT 기반의 F0 분해를 통해 다중 척도 억양 모델링이 가능해졌으며, 단일 척도 F0 표현보다 계층적인 억양 패턴을 더 효과적으로 포착할 수 있었다.
- 콘텐츠 독립적인 억양 학습 덕분에 새로운 언어적 콘텐츠에 대한 일반화 능력이 뛰어나며, 특히 데이터가 적은 환경에서 유의미한 성능 향상을 보였다.
- 적대적 손실과 사이클 일치성 손실을 활용함으로써 비병렬 데이터에서 효과적인 가짜 쌍 발견이 가능해져 고해상도의 정서 음성 변환을 실현했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.