[논문 리뷰] Statistical Parametric Speech Synthesis Using Generative Adversarial Networks Under A Multi-task Learning Framework
이 논문은 통계적 파arametric 음성 합성(SPSS)을 위한 다중 작업 학습 프레임워크를 제안한다. 이 프레임워크는 생성적 적대적 네트워크(GAN)와 평균 제곱 오차(MSE) 손실을 결합하여 인간의 청취 감각을 향상시키는 데 목적이 있다. GAN의 판별자에 의해 청취 품질을 향상시키고, MSE 손실을 통해 학습을 안정화시키기 위해 동시에 최적화함으로써, 기준 시스템보다 더 자연스러운 음성을 생성한다. 주관적 청취 테스트에서 이는 뚜렷한 향상으로 확인되었다.
In this paper, we aim at improving the performance of synthesized speech in statistical parametric speech synthesis (SPSS) based on a generative adversarial network (GAN). In particular, we propose a novel architecture combining the traditional acoustic loss function and the GAN's discriminative loss under a multi-task learning (MTL) framework. The mean squared error (MSE) is usually used to estimate the parameters of deep neural networks, which only considers the numerical difference between the raw audio and the synthesized one. To mitigate this problem, we introduce the GAN as a second task to determine if the input is a natural speech with specific conditions. In this MTL framework, the MSE optimization improves the stability of GAN, and at the same time GAN produces samples with a distribution closer to natural speech. Listening tests show that the multi-task architecture can generate more natural speech that satisfies human perception than the conventional methods.
연구 동기 및 목표
- 수치적 손실(예: MSE)을 최소화하는 것만으로는 인간의 청취 감각이 향상되지 않는 통계적 파arametric 음성 합성(SPSS)에서의 청취 부족 문제를 해결하기 위해.
- GAN 기반 음성 합성에서 흔히 발생하는 불안정성과 모드 붕괴 문제를 기존의 MSE 손실 함수를 통합하여 완화하기 위해.
- 실제 음성과 합성 음성 간의 청취적 차이를 포착할 수 있는 판별자의 능력을 활용하여 음성 자연스러움을 향상시키기 위해.
- 다중 작업 학습(MTL) 프레임워크가 TTS에서 동시에 학습 안정성 향상과 청취 품질 향상을 달성할 수 있는지 탐색하기 위해.
- GAN 기반 생성 방식이 객관적 및 주관적 지표 모두에서 표준 BLSTM 기반 TTS와 다른 GAN 변종보다 우수한 성능을 보이는지 평가하기 위해.
제안 방법
- 프레임워크는 생성자(음성 모델)가 평균 제곱 오차(MSE) 손실과 GAN 적대적 손실을 동시에 사용하는 다중 작업 학습 설정을 사용한다.
- 생성자는 언어적 특징에 조건부로 음성 파arameter를 생성하고, 판별자는 생성된 음성이 실제인지 가짜인지 평가하여 청취 품질 향상을 위한 피드백을 제공한다.
- MSE 손실은 수치적 안정성을 보장하고, 타겟 음성 특징의 정확한 재구성으로 향한 가이드 역할을 하여 모드 붕괴를 방지한다.
- GAN 손실은 음성 합성기 출력에 적용되어 판별자가 자연 음성과 합성 음성 웨이브폼 간의 청취적 차이를 학습할 수 있도록 한다.
- 조건부 언어적 특징은 생성자를 지시하여 합성 과정에서 내용과 억양이 유지되도록 보장한다.
- 학습 과정은 생성자에 대한 MSE 및 적대적 목표를 번갈아 최적화하고, 판별자는 실제 샘플과 생성된 샘플을 구분하도록 업데이트된다.
실험 결과
연구 질문
- RQ1SPSS에서 기존의 MSE 손실과 GAN을 다중 작업 학습 프레임워크에 통합함으로써 합성 음성의 청취 품질을 향상시킬 수 있는가?
- RQ2GAN 판별자의 포함 여부가 더 자연스러운 억양과 '지저분한' 소리 같은 청취적 잡음 감소에 기여하는가?
- RQ3MTL 프레임워크는 GAN 기반 음성 합성에서 흔히 발생하는 불안정성과 모드 붕괴 문제를 어떻게 완화하는가?
- RQ4주관적 청취 테스트에서 GAN 기반 접근 방식이 기준 BLSTM 기반 TTS와 다른 GAN 변종보다 우수한가?
- RQ5실제 대 가짜 음성 구분을 하는 판별자가, 반도용 방지(ASV)와 같은 보조 작업에 대해 훈련된 판별자보다 더 효과적인가?
주요 결과
- 제안된 MTL 프레임워크는 A/B 선호도 테스트에서 기준 BLSTM 기반 TTS보다 유의미하게 높은 주관적 음성 품질을 달성했으며, p값 < 0.0001이었다.
- 청취자는 GAN 기반 시스템을 ASV 기반 방법보다 선호하여, GAN의 판별자가 음성 품질의 청취적 차이를 더 잘 포착한다는 것을 시사한다.
- GAN 기반 시스템은 특히 메르-세프스트럼 계수의 처음 몇 개에서 자연 음성에 가까운 전반적인 분산(GV) 값을 생성하여 스펙트럼 엔벨롭 모델링 향상을 보였다.
- 음성 분류를 판별자 입력으로 사용한 GAN-PC 변종은 유의미한 성능 저하(p < 0.001)를 보였으며, 이는 판별자 내 언어적 조건부 지도가 청취 품질에 악영향을 준다는 것을 시사한다.
- 직접 비교에서 BLSTM 시스템은 GAN-PC를 略으로 앞서는 성능을 보였으며(p = 0.0253), 이는 판별자에 음소 레이블을 추가하는 것이 청취 품질 향상에 오히려 역효과를 미친다는 것을 확인한다.
- 프레임워크는 기준 시스템과 유사한 객관적 손실 값을 유지했으며, 이는 향상된 성능이 수치 최적화가 아닌 청취적 성과 때문임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.