[논문 리뷰] End-to-End Adversarial Text-to-Speech
본 논문은 차분 가능한 미분 가능 정렬기와 적대적 학습을 사용해 문자나 음소를 직접 원시 음성으로 맵핑하는 엔드-투-엔드 TTS 시스템인 EATS를 제시하며, 최소한의 중간 감독으로 최첨단에 근접한 MOS를 달성한다.
Modern text-to-speech synthesis pipelines typically involve multiple processing stages, each of which is designed or learnt independently from the rest. In this work, we take on the challenging task of learning to synthesise speech from normalised text or phonemes in an end-to-end manner, resulting in models which operate directly on character or phoneme input sequences and produce raw speech audio outputs. Our proposed generator is feed-forward and thus efficient for both training and inference, using a differentiable alignment scheme based on token length prediction. It learns to produce high fidelity audio through a combination of adversarial feedback and prediction losses constraining the generated audio to roughly match the ground truth in terms of its total duration and mel-spectrogram. To allow the model to capture temporal variation in the generated audio, we employ soft dynamic time warping in the spectrogram-based prediction loss. The resulting model achieves a mean opinion score exceeding 4 on a 5 point scale, which is comparable to the state-of-the-art models relying on multi-stage training and additional supervision.
연구 동기 및 목표
- 문자 또는 음소 입력에서 직접 작동하여 원시 음성을 생성하는 엔드-투-엔드 TTS 모델을 동기부여하고 개발한다.
- 단일 미분 가능 생성기 내에서 중간 표현을 학습해 전통적 다중 단계 TTS 병목 현상을 제거한다.
- 적대적 피드백과 스펙트로그램 기반 예측 손실을 활용해 정렬 및 음성 충실도를 안내한다.
- 실시간 또는 가속 추론에 적합한 효율적인 피드포워드 학습 및 샘플링을 가능하게 한다.
- 감독 데이터를 줄인 상태에서 엔드-투-엔드 학습이 최신 품질에 근접할 수 있음을 보여준다.
제안 방법
- 미분 가능 정렬기(단조 보간을 통한 200 Hz 정렬 표현)와 디코더(24 kHz로 업샘플링)로 구성된 두 블록 생성기로 원시 음성을 생성한다.
- 입력 조건화된 화자 임베디드 잠재 공간을 GAN-TTS에서 영감을 받은 디코더가 파형을 생성하는 데 사용한다.
- 랜덤 윈도우 판별기의 앙상블(RWDs)과 스펙트로그램 판별기를 통해 원시 음성과 그 스펙트럼 특성에 대한 적대적 피드백을 제공한다.
- 로그-멜 도메인에서의 스펙트로그램 예측 손실로 초기 학습을 통해 정렬을 안내하고, 정확한 정렬을 완화하는 소프트 DTW 손실을 보완한다.
- 토큰 길이 예측이 시간적 정렬을 안내하는 단조 보간 기반 정렬기와 현실적인 발화 길이를 촉진하는 길이 손실을 포함한다.
- 음소 또는 문자 입력을 통한 텍스트 전처리, 선택적 음소화 및 정규화, 침묵을 수용하기 위한 패딩을 포함한다.
실험 결과
연구 질문
- RQ1중간 정렬된 언어 특징 없이 텍스트나 음소로부터 직접 자연스러운 음성을 합성하는 엔드-투-엔드 피드포워드 TTS 모델이 가능할까?
- RQ2미분 가능 정렬과 적대적 피드백이 엔드-투-엔드 TTS 프레임워크에서 정확한 길이 모델링과 파형 생성을 어떻게 가능하게 할까?
- RQ3소프트 동적 시간 워핑(soft-DTW)과 스펙트로그램 기반 손실의 도입이 비자회귀(non-autoregressive) 생성기에서 정렬 학습과 음향 충실도를 향상시키는가?
- RQ4다중 화자 훈련 데이터와 단일 화자 데이터가 엔드-투-엔드 TTS 시스템의 자연스러움(MOS)에 미치는 영향은 무엇인가?
- RQ5감독 데이터를 줄인 상태에서 엔드-투-엔드 적대적 TTS가 최신 품질에 얼마나 근접할 수 있는가?
주요 결과
- 기본 다중 화자 EATS 모델은 평균 의견 점수(MOS) 4.083 ± 0.049로, 최신 결과에 근접한다.
- 변수 실험은 랜덤 윈도우 판별기, 멜 스펙트로그램 판별기, 혹은 일반적인 판별기를 제거하면 MOS가 저하됨을 보여주어 적대적 피드백의 중요성을 강조한다.
- DTW 기반 스펙트로그램 예측 손실과 단조 보간 정렬기가 대안들에 비해 시간적 정확성과 자연스러움을 실질적으로 향상시킨다.
- 대규모 다중 화자 데이터셋(69 화자, 약 260시간)에서의 학습이 단일 화자 학습 대비 MOS를 향상시키며, 단일 화자 애플레이션의 MOS는 3.829이다.
- 음소 기반 입력이 원시 문자 입력에 비해 발음 신뢰성을 향상시켜 보고된 평가에서 더 높은 MOS를 산출한다.
- 모델은 피드포워드 모드로 작동하며 단일 NVIDIA V100 GPU에서 실시간의 200배 속도로 음성을 생성할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.