[논문 리뷰] Towards Multi-Scale Style Control for Expressive Speech Synthesis
이 논문은 종단간 표현적 TTS를 위한 다중 척도 기반 참조 인코더를 제안하며, 참조 음성에서 종합적 스타일 임베딩(GSE)과 국소적 억양 임베딩(LPE)을 동시에 추출함으로써 문장 수준의 정서와 세밀한 억양을 동시에 제어할 수 있도록 한다. 이 방법은 특히 비병렬 및 교차 정서 설정에서 스타일 전이 정확도와 강인성을 향상시키며, 객관적 및 주관적 평가에서 단일 척도 기반 기준 모델을 능가한다.
This paper introduces a multi-scale speech style modeling method for end-to-end expressive speech synthesis. The proposed method employs a multi-scale reference encoder to extract both the global-scale utterance-level and the local-scale quasi-phoneme-level style features of the target speech, which are then fed into the speech synthesis model as an extension to the input phoneme sequence. During training time, the multi-scale style model could be jointly trained with the speech synthesis model in an end-to-end fashion. By applying the proposed method to style transfer task, experimental results indicate that the controllability of the multi-scale speech style model and the expressiveness of the synthesized speech are greatly improved. Moreover, by assigning different reference speeches to extraction of style on each scale, the flexibility of the proposed method is further revealed.
연구 동기 및 목표
- 기존의 표현적 TTS 모델이 전역적 또는 국소적 스타일 하나에만 집중함으로써 문장 수준의 정서나 세밀한 억양 제어가 불량해지는 한계를 해결하기 위해.
- 전역적(예: 화자 톤, 정서)과 국소적(예: 음고, 에너지, 정지) 스타일 특징을 동시에 모델링할 수 있는 통합된 종단간 훈련 가능한 프레임워크를 개발하기 위해.
- 참조 어텐션 메커니즘을 통해 다중 척도 스타일 특징을 TTS 기반 구조에 통합함으로써 합성 음성의 제어 가능성과 표현력을 향상시키기 위해.
- 병렬 데이터가 필요 없이 여러 참조 음성(예: 하나의 참조에서 전역 정서를, 다른 참조에서 국소 억양을 조합)을 사용해 영리한 스타일 전이를 가능하게 하기 위해.
제안 방법
- 참조 음성 입력의 멜스펙트로그램으로부터 종합적 스타일 임베딩(GSE) 벡터와 국소적 억양 임베딩(LPE) 시퀀스를 동시에 추출할 수 있도록 다중 척도 기반 참조 인코더를 설계하였다.
- 입력 스펙트로그램을 다운샘플링하기 위해 스트라이드 컨벌루션을 사용하여, 음소 수준에 가까운 해상도의 중간 특징을 생성함으로써 음소 단위와의 정렬을 향상시켰다.
- LPE 시퀀스는 참조 어텐션 메커니즘을 사용하여 음소 시퀀스와 정렬되었으며, 어텐션 기반 TTS의 콘텐츠 기반 어텐션과 유사하다.
- 다중 척도 기반 참조 인코더와 참조 어텐션은 종단간 훈련 방식으로 TTS 모델과 함께 공동으로 최적화되어 스타일 모델링과 음성 생성의 공동 최적화를 가능하게 하였다.
- 다른 참조 음성으로부터 전역 및 국소 스타일 구성 요소를 할당함으로써 비병렬 및 교차 정서 스타일 전이를 지원하였다.
- 모델 아키텍처는 인코더-디코더 구조를 가진 TTS 기반 구조를 사용하여, 스타일 특징을 음소 임베딩에 연결함으로써 조건부 생성을 수행하였다.
실험 결과
연구 질문
- RQ1보조 레이블이나 별도의 훈련 단계 없이도 통합된 종단간 TTS 시스템이 전역 및 국소 음성 스타일 특징을 효과적으로 모델링할 수 있는가?
- RQ2다중 척도 스타일 모델링은 종합적 정서와 세밀한 억양 측면에서 합성 음성의 제어 가능성에 어떻게 기여하는가?
- RQ3프레임 척도가 아닌 음소에 가까운 준-음소 척도의 스타일 특징을 사용할 경우, 참조 어텐션 및 음성 합성의 강인성과 정확도가 얼마나 향상되는가?
- RQ4비병렬 참조 음성에서 서로 다른 전역 및 국소 스타일 구성 요소를 조합함으로써 모델이 영리한 스타일 전이를 수행할 수 있는가?
- RQ5객관적 및 주관적 평가에서 제안된 방법이 단일 척도 기반 기준 모델(예: 전역 전용 또는 국소 전용)과 비교해 어떻게 성능을 냈는가?
주요 결과
- 제안된 다중 척도 모델은 평가된 평균 관점 점수(MOS)를 통해 단일 척도 기준 모델보다 전역 정서 및 국소 억양 전이에서 뚜렷한 성능 향상을 보였다.
- 주관적 평가 결과, 제안 모델은 전역 정서(MOS 평균: 4.21)와 국소 억양(MOS 평균: 4.15) 모두에서 기준 모델보다 더 높은 유사도 점수를 확보하였다.
- 모델은 교차 정서 스타일 전이를 성공적으로 수행하였으며, 하나의 참조에서 전역 정서를 전이하면서 다른 참조에서 국소 억양을 유지함으로써 높은 유연성을 입증하였다.
- 준-음소 척도의 LPE 표현은 더 강인한 참조 어텐션 정렬을 이끌었으며, 마지막 음소를 생성하지 못하는 프레임 척도 기반 기준 모델(Base-FS)과는 달리 최종 음소 합성 오류를 방지하였다.
- 비병렬 스타일 전이 상황에서도 높은 품질과 일관성을 유지하여, 모델이 병렬 훈련 데이터를 초월해 다양한 참조 입력을 효과적으로 처리할 수 있음을 보여주었다.
- 제거 실험 결과, 다운샘플링을 제거함(즉, 프레임 척도로 복귀함)하면 참조 어텐션 정렬과 음성 품질이 떨어지므로, 준-음소 척도의 해상도가 중요함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.