[논문 리뷰] Learning latent representations for style control and transfer in end-to-end speech synthesis
이 논문은 엔드 투 엔드 TTS 모델에 변분 오토인코더(VAE)를 도입하여 비지도 학습 방식으로 발화 스타일의 분리된 연속 잠재 표현을 학습한다. 참고 음성에서 스타일 코드를 추출하고 이를 조작함으로써 모델은 정밀한 스타일 제어를 가능하게 하며, 병렬 및 비병렬 스타일 전이 모두에서 Global Style Token(GST) 모델보다 ABX 선호도 테스트에서 뛰어난 성능을 보인다.
In this paper, we introduce the Variational Autoencoder (VAE) to an end-to-end speech synthesis model, to learn the latent representation of speaking styles in an unsupervised manner. The style representation learned through VAE shows good properties such as disentangling, scaling, and combination, which makes it easy for style control. Style transfer can be achieved in this framework by first inferring style representation through the recognition network of VAE, then feeding it into TTS network to guide the style in synthesizing speech. To avoid Kullback-Leibler (KL) divergence collapse in training, several techniques are adopted. Finally, the proposed model shows good performance of style control and outperforms Global Style Token (GST) model in ABX preference tests on style transfer.
연구 동기 및 목표
- 엔드 투 엔드 텍스트-음성 합성 시스템 내에서 비지도 학습을 통해 분리된 발화 스타일 표현을 학습하는 것.
- 학습된 잠재 변수를 직접 조작하여 세밀한 스타일 제어를 달성하는 것.
- 인식 네트워크를 사용해 참고 음성에서 스타일 코드를 추론함으로써 스타일 전이를 가능하게 하는 것.
- 참고 스타일과 타겟 스타일이 상당히 다를 경우에도 일반화 성능을 향상시키는 것.
- 음성 합성 맥락에서 VAE 학습 중 KL 발산 붕괴를 완화하는 것.
제안 방법
- Tacotron2 TTS 프레임워크에 VAE 모듈을 통합하여 발화 스타일을 위한 연속 잠재 공간을 학습하는 것.
- 참고 음성 입력으로부터 스타일 표현을 추론하기 위해 인식 네트워크 $q_{oldsymbol{ heta}}( extbf{z}| extbf{x})$ 를 사용하는 것.
- VAE 인코더에서 확률적 샘플링을 통해 역전파를 가능하게 하기 위해 재생성 기법을 적용하는 것.
- 가중치 공유 및 기울기 페널티와 같은 기법을 사용해 학습 중 KL 발산 붕괴를 방지하는 것.
- 학습된 잠재 스타일 코드 $\mathbf{z}$ 를 조건으로 하여 TTS 디코더를 조정함으로써 스타일 전이를 수행하는 것.
- 잠재 벡터 $\mathbf{z}$ 의 개별 차원을 조작함으로써 보간 및 분리된 제어를 가능하게 하는 것.
실험 결과
연구 질문
- RQ1VAE는 엔드 투 엔드 TTS 시스템 내에서 비지도 학습 방식으로 분리되고 해석 가능한 발화 스타일 잠재 표현을 학습할 수 있는가?
- RQ2학습된 잠재 공간이 스타일 특성의 연속적 보간과 덧셈 조합을 얼마나 잘 지원하는가?
- RQ3제안된 VAE 기반 스타일 표현은 GST 모델보다 더 나은 스타일 전이 성능을 제공하는가?
- RQ4참고 스타일과 타겟 스타일이 서로 다른 화자 또는 조건에서 오는 경우, 모델은 비병렬 스타일 전이에 대해 얼마나 잘 일반화되는가?
- RQ5쌍체 참조 데이터가 필요 없이도 고품질의 스타일 제어를 달성할 수 있는가?
주요 결과
- VAE 기반 잠재 공간은 스타일 표현 간의 부드러운 보간을 가능하게 하여 음고, 발화 속도, 억양의 점진적 변화를 유도한다.
- 잠재 벡터의 개별 차원은 음고 높이, 국소적 음고 변동성, 발화 속도와 같은 특정 스타일 특성을 제어하며, 이는 분리성의 증거가 된다.
- 모델은 ABX 선호도 테스트에서 GST 모델을 뛰어넘는 성능을 보이며, 병렬 및 비병렬 스타일 전이 모두에서 p값 < 10^-5 로 유의미한 우월성을 확보한다.
- 비병렬 스타일 전이에서 뚜렷한 일반화 성능 향상을 보이며, 스타일 도메인 이동에 대한 강건성을 시사한다.
- 학습된 잠재 표현은 스타일 제어를 위한 직접적 조작과 사전 분포에서 샘플링을 통한 데이터 증강을 가능하게 한다.
- 아키텍처적 및 학습 기법을 통해 KL 발산 붕괴가 완화되어 안정적인 학습과 의미 있는 사후 추론을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.