[논문 리뷰] Mixture Density Network for Phone-Level Prosody Modelling in Speech Synthesis.
이 논문은 텍스트-to-음성 합성에서 음소 수준의 억양 모델링을 위해 가우시안 혼합 모델(GMM)을 활용한 혼합 밀도 신경망(MDN)을 제안한다. 단일 모드 가우시안 분포 대신 GMM 기반 MDN을 도입함으로써, 복잡한 억양 변동을 더 효과적으로 포착할 수 있으며, LJSpeech 데이터셋에서 추론 속도 저하 없이 억양 다양성과 음성 자연스러움을 크게 향상시킨다.
Recent researches on both utterance-level and phone-level prosody modelling successfully improve the voice quality and naturalness in text-to-speech synthesis. However, most of them model the prosody with a unimodal distribution such like a single Gaussian, which is not reasonable enough. In this work, we focus on phone-level prosody modelling where we introduce a Gaussian mixture model(GMM) based mixture density network. Our experiments on the LJSpeech dataset demonstrate that GMM can better model the phone-level prosody than a single Gaussian. The subjective evaluations suggest that our method not only significantly improves the prosody diversity in synthetic speech without the need of manual control, but also achieves a better naturalness. We also find that using the additional mixture density network has only very limited influence on inference speed.
연구 동기 및 목표
- 단일 가우시안 분포와 같은 단일 모드 억양 모델링의 한계를 해결하기 위해, 음성 억양 내 임베디드 변동성을 포착하지 못하는 문제를 해결한다.
- 더 유연한 분포를 사용하여 음소 수준의 억양을 모델링하여 합성 음성의 다양성과 자연스러움을 향상시키기 위해 노력한다.
- 억양 모델링을 TTS 파이프라인에 직접 통합할 수 있는 미분 가능하고 엔드 투 엔드로 훈련 가능한 프레임워크를 개발한다.
- 제안된 GMM 기반 MDN이 표준 모델과 비교해 효율적인 추론 속도를 유지하는지 평가한다.
제안 방법
- 음소 수준의 맥락을 기반으로 한 억양 특징의 조건부 분포를 모델링하기 위해 혼합 밀도 신경망(MDN)을 사용한다.
- 표준 MDN의 단일 가우시안 출력을 다중 모드 억양 변동을 더 잘 포착할 수 있도록 가우시안 혼합 모델(GMM)으로 대체한다.
- GMM 구성 요소(평균, 분산, 혼합 가중치)의 미분 가능한 파arameterization을 활용하여 엔드 투 엔드 훈련을 가능하게 한다.
- 음소 임베딩을 입력으로 사용하여 LJSpeech 데이터셋에서 훈련하여 f0, 에너지, 지속 시간 등의 억양 특징을 예측한다.
- 훈련 중 GMM 샘플링 과정을 통해 역전파를 가능하게 하기 위해 재생성 기법을 적용한다.
- 가벼운 GMM 통합 MDN 아키텍처를 사용하여 계산 오버헤드를 최소화함으로써 추론 속도를 유지한다.
실험 결과
연구 질문
- RQ1GMM 기반 혼합 밀도 신경망은 단일 모드 가우시안 분포보다 음소 수준의 억양을 더 효과적으로 모델링할 수 있는가?
- RQ2제안된 방법은 수동 제어 없이도 합성 음성의 억양 다양성과 자연스러움을 향상시키는가?
- RQ3표준 TTS 모델과 비교해 GMM 통합 MDN의 추론 속도에 어떤 영향을 미치는가?
- RQ4주관적 평가에서 자연스러움과 표현력 측면에서 모델의 성능은 어떠한가?
주요 결과
- GMM 기반 MDN은 단일 가우시안 분포를 사용하는 모델과 비교해 합성 음성의 억양 다양성을 크게 향상시킨다.
- 주관적 평가 결과, 제안된 방법은 베이스라인 모델보다 높은 자연스러움 점수를 확보한다.
- 표준 MDN 기반 TTS 시스템과 거의 동일한 추론 속도를 유지하여 계산 오버헤드가 최소임을 확인한다.
- 단일 모드 모델이 포착하지 못하는 복잡한 다중 모드 억양 패턴을 음소 수준에서 성공적으로 모델링한다.
- 수동 억양 제어가 없음에도 불구하고, 데이터로부터 다양한 억양 변동을 학습할 수 있는 능력으로 인해 이로 인한 손실이 보완된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.