[논문 리뷰] PortaSpeech: Portable and High-Quality Generative Text-to-Speech
PortaSpeech는 비자기적 텍스트-to-음성 모델로, 변동형 자료화기(VAE)와 향상된 사전 분포, 플로우 기반 포스트넷을 조합하여 표현력 있고 자연스러운 음성, 풍부한 억양 및 세밀한 스펙트럼 세부 정보를 생성한다. 단지 670만 개의 파라미터로 구성되어 있어 FastSpeech 2보다 약 4배 작고 메모리 효율성이 약 3배 높으며, 혁신적인 언어 인코더(혼합 정렬 및 그룹화된 파라미터 공유)를 통해 높은 품질을 유지한다.
Non-autoregressive text-to-speech (NAR-TTS) models such as FastSpeech 2 and Glow-TTS can synthesize high-quality speech from the given text in parallel. After analyzing two kinds of generative NAR-TTS models (VAE and normalizing flow), we find that: VAE is good at capturing the long-range semantics features (e.g., prosody) even with small model size but suffers from blurry and unnatural results; and normalizing flow is good at reconstructing the frequency bin-wise details but performs poorly when the number of model parameters is limited. Inspired by these observations, to generate diverse speech with natural details and rich prosody using a lightweight architecture, we propose PortaSpeech, a portable and high-quality generative text-to-speech model. Specifically, 1) to model both the prosody and mel-spectrogram details accurately, we adopt a lightweight VAE with an enhanced prior followed by a flow-based post-net with strong conditional inputs as the main architecture. 2) To further compress the model size and memory footprint, we introduce the grouped parameter sharing mechanism to the affine coupling layers in the post-net. 3) To improve the expressiveness of synthesized speech and reduce the dependency on accurate fine-grained alignment between text and speech, we propose a linguistic encoder with mixture alignment combining hard inter-word alignment and soft intra-word alignment, which explicitly extracts word-level semantic information. Experimental results show that PortaSpeech outperforms other TTS models in both voice quality and prosody modeling in terms of subjective and objective evaluation metrics, and shows only a slight performance degradation when reducing the model parameters to 6.7M (about 4x model size and 3x runtime memory compression ratio compared with FastSpeech 2). Our extensive ablation studies demonstrate that each design in PortaSpeech is effective.
연구 동기 및 목표
- 비자기적 텍스트-to-음성(NAR-TTS) 시스템에서 모델 효율성과 음성 품질 간의 상충 관계를 해결한다.
- 엣지 배포를 위한 최소한의 계산 및 메모리 오버헤드로 고해상도이고 표현력 있는 음성 합성을 가능하게 한다.
- 정밀한 음소 수준의 정렬에 대한 의존도를 줄이기 위해 언어 인코더에 하이브리드 정렬 메커니즘을 도입한다.
- VAE와 정규화 플로우를 조합한 하이브리드 아키텍처를 통해 억양 모델링 및 스펙트럼 세부 정보 복원을 향상시킨다.
- 극도로 제한된 파라미터 및 메모리 조건에서도 높은 성능을 유지하는 컴act하고 효율적인 모델을 개발한다.
제안 방법
- 두 단계의 생성 아키텍처를 채택: 장거리 억양 구조를 모델링하기 위해 향상된 사전 분포를 가진 경량 변동형 자료화기(VAE)를 사용하고, 이후 세밀한 멜-스펙트로그램 세부 정보를 개선하기 위해 플로우 기반 포스트넷을 적용한다.
- 플로우 기반 포스트넷의 애핀 커플링 레이어에 그룹화된 파라미터 공유 메커니즘을 도입하여 모델 크기와 메모리 프로파일을 감소시키되 성능 저하를 최소화한다.
- 하드 워드 수준 정렬과 소프트 음소 수준 정렬을 결합한 혼합 정렬을 사용하는 언어 인코더를 설계하여 지속시간 예측 성능을 향상시키고 정밀한 음소 수준 정렬에 대한 의존도를 감소시킨다.
- 복잡한 억양 패턴을 더 잘 포착하기 위해 비정규 분포를 가진 향상된 사전 분포를 갖춘 VAE를 사용하여 소형 모델에서도 우수한 성능을 발휘한다.
- 재구성 손실, KL 발산, 플로우 기반 가능도 최적화를 조합하여 엔드 투 엔드 모델을 훈련시켜 품질과 다양성 양면에서 최적화한다.
- 향상된 사전 분포와 플로우 기반 개선을 통해 지식 정복 또는 기타 정규화 기법을 암묵적으로 적용하여 훈련 안정성과 일반화 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1비자기적 TTS 모델은 어떻게 최소한의 모델 크기와 메모리 프로파일로 고품질의 음성 합성을 달성할 수 있는가?
- RQ2VAE 기반 및 정규화 플로우 기반 아키텍처는 TTS에서 억양과 스펙트럼 세부 정보를 모델링할 때 각각 어떤 강점과 약점이 있는가?
- RQ3VAE와 정규화 플로우를 조합한 하이브리드 아키텍처는 독립적인 모델 대비 음성 품질과 억양 모델링에서 뛰어난 성능을 낼 수 있는가?
- RQ4언어 인코더에 혼합 정렬 메커니즘이 도입될 경우 억양 모델링 성능 향상과 세밀한 정렬 감독에 대한 의존도 감소에 기여하는가?
- RQ5특히 자연스러움과 표현력 측면에서 심각한 품질 저하 없이 상당한 모델 압축을 달성할 수 있는가?
주요 결과
- PortaSpeech는 주관적(CMOS) 및 객관적 평가 지표에서 모두 최신 기준 수준의 성능을 달성하여, 음성 품질과 억양 모델링에서 FastSpeech 2와 Glow-TTS를 모두 능가한다.
- 단지 670만 개의 파라미터로 구성되어 있어 FastSpeech 2 대비 모델 크기를 약 4배 감소시키고, 메모리 프로파일을 약 3배 감소시켰으며, 성능 저하가 미미하다.
- VAE의 향상된 사전 분포 덕분에 억양 모델링이 크게 향상되었으며, 단순한 정규 분포 사전 분포 대비 CMOS-P에서 0.194점 향상된 것으로 확인되었다.
- 플로우 기반 포스트넷은 포스트넷을 제거했을 경우 대비 CMOS-Q에서 0.458점 향상되었으며, 표준 컨볼루션 포스트넷보다도 뛰어난 성능을 보였다.
- 언어 인코더의 혼합 정렬 메커니즘 덕분에 음소 수준의 하드 정렬 대비 평균 절대 지속시간 오차가 워드 수준에서 40.4ms 감소하고 문장 수준에서 0.44초 감소하였다.
- 제거 실험 결과 각 구성 요소—향상된 사전 분포, 플로우 기반 포스트넷, 혼합 정렬—가 전체 성능 향상에 기여하며, 전체 모델이 가장 높은 CMOS 점수를 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.