[논문 리뷰] A New GAN-based End-to-End TTS Training Algorithm
이 논문은 노출 편향을 완화하기 위해 교수력(Professor Forcing)을 통합한 GAN 기반 엔드 투 엔드 TTS 학습 알고리즘을 제안한다. 이는 실제 시퀀스와 생성된 시퀀스 양측에서 생성자와 판별기를 함께 훈련시켜, 자동회귀 TTS 모델의 노출 편향 문제를 해결한다. 주관적 평가에서 교사 강요(teacher forcing)와 순차적 샘플링(scheduled sampling)을 능가하며, 음성 자연성(음성 평가 점수 CMOS +0.1)과 일반화 능력(비이해 가능성 비율 11.1%에서 4%로 감소) 향상에 기여한다.
End-to-end, autoregressive model-based TTS has shown significant performance improvements over the conventional one. However, the autoregressive module training is affected by the exposure bias, or the mismatch between the different distributions of real and predicted data. While real data is available in training, but in testing, only predicted data is available to feed the autoregressive module. By introducing both real and generated data sequences in training, we can alleviate the effects of the exposure bias. We propose to use Generative Adversarial Network (GAN) along with the key idea of Professor Forcing in training. A discriminator in GAN is jointly trained to equalize the difference between real and predicted data. In AB subjective listening test, the results show that the new approach is preferred over the standard transfer learning with a CMOS improvement of 0.1. Sentence level intelligibility tests show significant improvement in a pathological test set. The GAN-trained new model is also more stable than the baseline to produce better alignments for the Tacotron output.
연구 동기 및 목표
- 자기회귀 엔드 투 엔드 TTS에서 학습은 실제 시퀀스를 사용하지만 추론은 예측된 시퀀스에 의존하는 노출 편향 문제를 해결한다.
- 긴 문장이나 병리적 입력과 같은 새로운 또는 복잡한 입력 시퀀스에 대한 모델의 일반화 능력과 강건성 향상.
- 실제 음성 시퀀스와 생성된 음성 시퀀스 간의 분포 불일치를 줄여 음성 품질과 자연성을 향상시킨다.
- 주의 분할 안정화와 장시퀀스 생성에서의 오류 누적 감소를 위한 훈련 프레임워크 개발.
제안 방법
- 생성자(TTS 모델)가 교사 강요(실제 입력) 및 자유 주행(예측된 입력) 방식으로 음성 시퀀스를 생성하는 GAN 기반 훈련 프레임워크 도입.
- 판별기가 실제 시퀀스(교사 강요)의 은닉 상태 및 출력과 생성된 시퀀스(자유 주행)를 구분하도록 훈련하여 분포 불일치를 최소화.
- 대칭 훈련을 통해 실제 데이터와 생성된 데이터의 분포를 일치시켜, 학습 중 생성자에게 자신의 예측을 노출함으로써 노출 편향을 감소.
- 교수력 원칙을 적용하여 생성자에 대해 가능도 최대화와 적대적 진실성 양측을 함께 최적화.
- 추가로 일반화 향상을 위해 GAN 기반 훈련과 순차적 샘플링(SS)을 조합하여 음성 품질 저하 없이 성능 향상.
- 이중 단계 훈련 목표 적용: (1) 실제 시퀀스에서 가능도 최대화, (2) 판별기 손실 최소화로 생성된 시퀀스가 실제 시퀀스와 구분되지 않도록 유도.
실험 결과
연구 질문
- RQ1생성된 시퀀스를 학습 중에 통합함으로써 GAN 기반의 적대적 훈련이 자동회귀 TTS 모델의 노출 편향을 효과적으로 줄일 수 있는가?
- RQ2제안된 GAN 기반 훈련은 음성 자연성과 이해 가능성 측면에서 교사 강요 및 순차적 샘플링보다 어떻게 비교되는가?
- RQ3GAN 훈련과 순차적 샘플링을 조합하면 음성 품질을 유지하면서도 일반화 능력을 향상시킬 수 있는가?
- RQ4제안된 방법이 장기간 또는 복잡한 입력 시퀀스에서 주의 분할 안정화와 오류 누적 감소에 얼마나 기여하는가?
주요 결과
- TF-GAN 모델은 표준 교사 강요 대비 CMOS 점수에서 +0.1 향상되었으며, 선호도 비율도 5.33% 높아져 통계적으로 유의미하다(p=0.02).
- TF-GAN 모델은 병리적 테스트 세트에서 비이해 가능성 비율을 교사 강요(TF)의 11.1%에서 4%로 감소시켜 일반화 능력 향상을 뚜렷이 보였다.
- 순차적 샘플링만으로는 음성 품질이 저하됨(CMOS -0.04)했지만 일반화 능력은 향상되어 품질과 강건성 사이의 상충 관계를 확인했다.
- SS-GAN 조합은 높은 음성 품질을 유지하면서도 비이해 가능성 비율을 2.22%로 낮춰 일반화 능력 향상에 성공했으며 품질 손실 없이 성능 향상을 달성했다.
- 장문이나 복잡한 문장에서 발생하는 악성 케이스의 50% 이상이 GAN 기반 훈련 적용 후 수정되어 장기적 맥락 입력에 대한 강건성 향상을 입증했다.
- 실제 데이터와 생성된 데이터 간의 분포 불일치를 최소화함으로써 주의 분할 안정화와 오류 전파 감소를 달성했으며, 특히 장시퀀스 디코딩에서 두드러진 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.