[논문 리뷰] MsEmoTTS: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis
MsEmoTTS는 글로벌(카테고리), 문장(프로소디 패턴), 로컬(음절 수준 강도) 수준에서 세 가지 전용 모듈을 사용해 감정을 다중 척도로 모델링하는 다중 척도 감정 음성 합성 프레임워크를 제안한다. 참조 오디오 전송, 텍스트 기반 감정 예측, 수동 감정 강도 제어를 통해 민감도 높은 감정 음성 합성을 가능하게 하며, 중국어 코퍼스에서 감정 전송 및 예측 작업에서 이전 방법들을 능가한다.
Expressive synthetic speech is essential for many human-computer interaction and audio broadcast scenarios, and thus synthesizing expressive speech has attracted much attention in recent years. Previous methods performed the expressive speech synthesis either with explicit labels or with a fixed-length style embedding extracted from reference audio, both of which can only learn an average style and thus ignores the multi-scale nature of speech prosody. In this paper, we propose MsEmoTTS, a multi-scale emotional speech synthesis framework, to model the emotion from different levels. Specifically, the proposed method is a typical attention-based sequence-to-sequence model and with proposed three modules, including global-level emotion presenting module (GM), utterance-level emotion presenting module (UM), and local-level emotion presenting module (LM), to model the global emotion category, utterance-level emotion variation, and syllable-level emotion strength, respectively. In addition to modeling the emotion from different levels, the proposed method also allows us to synthesize emotional speech in different ways, i.e., transferring the emotion from reference audio, predicting the emotion from input text, and controlling the emotion strength manually. Extensive experiments conducted on a Chinese emotional speech corpus demonstrate that the proposed method outperforms the compared reference audio-based and text-based emotional speech synthesis methods on the emotion transfer speech synthesis and text-based emotion prediction speech synthesis respectively. Besides, the experiments also show that the proposed method can control the emotion expressions flexibly. Detailed analysis shows the effectiveness of each module and the good design of the proposed method.
연구 동기 및 목표
- 기존의 표현적 TTS 시스템에서 단일 척도 감정 모델링의 한계를 해결하기 위해 인간의 프로소디의 다중 분해능 특성을 포괄하지 못하는 문제를 해결한다.
- 세 가지 별도의 모드인 참조 기반 감정 전송, 텍스트 기반 감정 예측, 수동 감정 강도 제어를 통해 감정 음성 합성의 유연성을 보장한다.
- 글로벌 감정 카테고리, 문장 수준의 프로소디 변동, 음절 수준의 감정 강도라는 세 수준의 계층적 감정 모델링을 수행한다.
- 다양한 음성 단위에서의 미세한 감정 변동을 포착함으로써 합성 음성의 표현력과 다양성을 향상시킨다.
제안 방법
- 모델은 세 가지 전용 모듈을 갖춘 어텐션 기반 순차적-순차적 아키텍처를 사용한다: 글로벌 수준 감정 표현 모듈(GM), 문장 수준 감정 표현 모듈(UM), 로컬 수준 감정 표현 모듈(LM).
- GM은 사전 훈련된 감정 분류기를 사용하여 문장의 전반적인 감정 카테고리를 분류함으로써 글로벌 스타일 신호를 제공한다.
- UM은 문장 내에서 톤과 에너지의 변동을 모델링하여 프로소디 패턴(예: 음높이 윤곽)을 학습한다.
- LM은 음절 수준에서 감정 강도 값을 할당하여 국소적 감정 강도를 제어하며, 실험 결과 중국어에서는 음소보다 음절이 더 적합함을 확인했다.
- 참조 오디오 또는 텍스트로부터 유도된 감정 표현은 적응형 레이어 정규화를 통해 TTS 디코더에 통합되어 스타일 전송 및 제어가 가능하다.
- 다중 작업 학습을 통한 엔드 투 엔드 훈련을 지원하며, 감정 분류 및 강도 예측이 공동 최적화된다.
실험 결과
연구 질문
- RQ1글로벌, 문장, 로컬 수준의 다중 척도 감정 모델링이 합성 감정 음성의 표현력과 자연스러움을 향상시키는가?
- RQ2제안된 다중 척도 감정 표현 방식이 참조 기반 또는 레이블 기반 단일 척도 방법과 비교해 감정 전송 및 예측 작업에서 어떻게 성능을 냈는가?
- RQ3중국어 음성에서 음절 수준 감정 강도를 사용할 경우, 음소 수준 또는 문장 수준 표현보다 합성 품질이 향상되는가?
- RQ4감정 카테고리와 강도를 수동으로 입력함으로써 모델이 얼마나 높은 감정 제어 유연성을 제공하는가?
주요 결과
- MsEmoTTS는 중국어 감정 음성 코퍼스에서 참조 기반 및 텍스트 기반 감정 TTS 방법보다 감정 전송 및 감정 예측 작업에서 모두 뛰어난 성능을 보였다.
- 음절 수준 감정 강도를 사용할 경우 멜-세프트럼 왜곡(MCD)이 4.11 dB로 측정되었으며, 문장 수준 강도를 사용한 경우 4.65 dB보다 유의미하게 낮아, 미세한 로컬 모델링의 이점을 확인했다.
- 음절 수준 감정 강도 방법은 음소 수준 방법보다 MCD 감소율에서 1.1% 높아, 조용한 언어인 중국어에 더 적합함을 시사한다.
- 멜 스펙트로그램과 f0 윤곽의 시각적 분석 결과, 문장 수준 모듈(UM)이 참조 오디오의 음높이 변동 추세를 성공적으로 포착하고 전송함을 확인했다.
- 글로벌 감정 카테고리와 국소 감정 강도를 수동으로 제어함으로써 원하는 감정 표현을 정밀하게 합성할 수 있었으며, 이는 모델의 유연성을 입증한다.
- GM과 UM에 서로 다른 감정 카테고리의 충돌적인 참조가 사용될 경우, 합성 음성이 비자연스러운 하이브리드 감정을 띠게 되어 글로벌 및 문장 수준의 프로소디 간 상호의존성이 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.