[논문 리뷰] Hierarchical Generative Modeling for Controllable Speech Synthesis
요약: 이 논문은 두 수준의 잠재 변수(이산 y_l과 연속 z_l)를 가진 신경 TTS 모델 GMVAE-Tacotron을 소개합니다. 이를 통해 Gaussian 혼합 prior를 VAE 프레임워크 내에 활용하여 화자, 스타일, 잡음 속성 간의 제어 가능한 음성 합성을 수행합니다.
This paper proposes a neural sequence-to-sequence text-to-speech (TTS) model which can control latent attributes in the generated speech that are rarely annotated in the training data, such as speaking style, accent, background noise, and recording conditions. The model is formulated as a conditional generative model based on the variational autoencoder (VAE) framework, with two levels of hierarchical latent variables. The first level is a categorical variable, which represents attribute groups (e.g. clean/noisy) and provides interpretability. The second level, conditioned on the first, is a multivariate Gaussian variable, which characterizes specific attribute configurations (e.g. noise level, speaking rate) and enables disentangled fine-grained control over these attributes. This amounts to using a Gaussian mixture model (GMM) for the latent distribution. Extensive evaluation demonstrates its ability to control the aforementioned attributes. In particular, we train a high-quality controllable TTS model on real found data, which is capable of inferring speaker and style attributes from a noisy utterance and use it to synthesize clean speech with controllable speaking style.
연구 동기 및 목표
- 데이터에 자주 주석이 달리지 않는 속성들(말하기 스타일, 악센트, 배경 잡음, 녹음 조건)에 대한 제어 가능한 TTS 동기를 제공합니다.
- 레이블이 있는 화자 속성과 라벨이 없는 잠재 속성을 분리하기 위한 계층적 변분 자동인코더 기반 모델을 제안합니다.
- 해석 가능한 잠재 클러스터 학습과 다양한 제어 가능한 음성을 위한 샘플링 메커니즘을 시연합니다.
- 다양한 녹음 조건과 보지 못한 화자에서 실제 수집 데이터에 대한 효과를 보입니다.
제안 방법
- Gaussian 혼합으로 모델링된 두 수준의 잠재 변수를 포함하도록 Tacotron 2를 확장합니다.
- p(y_l)를 균일 사전으로, p(z_l|y_l)를 대각 Gaussian으로 사용하여 잠재 공간에 GMM 사전을 형성합니다.
- VAE 프레임워크 내의 인코더 네트워크를 통해 q(z_l|X) 및 q(y_l|X) 추론하고 ELBO를 최적화합니다.
- 관찰 가능한 레이블과 연결된 클래스 내 변동성을 포착하기 위해 관찰된 속성 표현 z_o를 도입합니다.
- z_l, z_o, y_o(가능한 경우)를 통해 합성기를 조건화하여 잠재 속성의 해방된 제어를 달성합니다.
- 효율적인 학습과 높은 품질의 출력을 위해 WaveRNN 보코더가 포함된 Tacotron-2 기반 합성기를 사용합니다.
실험 결과
연구 질문
- RQ1이산 y_l과 연속 z_l로 이루어진 2단계 잠재 공간이 스타일, 잡음, 운율과 같은 잠재 음성 속성을 포착하고 해석적으로 분리할 수 있습니까?
- RQ2Gaussian 혼합 사전이 잠재 속성의 해석 가능한 클러스터링과 다양한 음성 합성에 대한 강건한 샘플링을 촉진합니까?
- RQ3모델이 노이즈가 있거나 보지 못한 화자에서 화자 독립적인 잠재 속성을 학습하고도 청결한 음성을 생성할 수 있습니까?
- RQ4GMVAE-Tacotron은 자연스러움과 SNR 측면에서 GST, VAE, 및 기본 Tacotron-2와 다양한 데이터셋에서 어떻게 비교됩니까?
- RQ5화자 정체성을 유지하면서 말하기 스타일과 잡음 속성을 독립적으로 샘플링하고 제어하는 것이 가능합니까?
주요 결과
- GMVAE-Tacotron은 청정/잡음 조건 및 화자 특성 등 속성과 일치하는 해석 가능한 잠재 클러스터를 달성합니다.
- 모델은 화자, 잡음, 스타일 속성에 대한 해방된 제어를 보여주며 각 요소를 독립적으로 조작할 수 있습니다.
- 잡음이 많은 다중 화자 코퍼스에서 GMVAE는 잡음이 있는 학습 데이터의 화자에 대해 청정 음성을 합성하고 baselines보다 MOS와 SNR이 높습니다.
- 연속 잠재 공간은 제어 가능한 속성으로 샘플링을 가능하게 하여 다양하고 자연스러운 운율과 말하기 스타일을 제공합니다.
- 실험은 화자 그룹(예: 악센트, 성별)과 같은 구성요소와 F0 및 속도와 같은 속성에 대한 차원별 제어의 높은 일관성을 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.