[논문 리뷰] Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation
Meta-StyleSpeech는 StyleSpeech를 메타러닝과 판별기로 확장하여 다중 화자 TTS에서 한 샷, 짧은 참조 발화로도 강력한 화자 적응을 달성합니다. 이는 <1초 참조 오디오에서도 고품질의 화자 일관성 있는 합성을 제공합니다.
With rapid progress in neural text-to-speech (TTS) models, personalized speech generation is now in high demand for many applications. For practical applicability, a TTS model should generate high-quality speech with only a few audio samples from the given speaker, that are also short in length. However, existing methods either require to fine-tune the model or achieve low adaptation quality without fine-tuning. In this work, we propose StyleSpeech, a new TTS model which not only synthesizes high-quality speech but also effectively adapts to new speakers. Specifically, we propose Style-Adaptive Layer Normalization (SALN) which aligns gain and bias of the text input according to the style extracted from a reference speech audio. With SALN, our model effectively synthesizes speech in the style of the target speaker even from single speech audio. Furthermore, to enhance StyleSpeech's adaptation to speech from new speakers, we extend it to Meta-StyleSpeech by introducing two discriminators trained with style prototypes, and performing episodic training. The experimental results show that our models generate high-quality speech which accurately follows the speaker's voice with single short-duration (1-3 sec) speech audio, significantly outperforming baselines.
연구 동기 및 목표
- 고품질이고 표현력이 풍부한 다중 화자 TTS가 아주 짧은 오디오 샘플 몇 개만으로 새로운 화자에 적응할 수 있도록 하는 것을 목표로 합니다.
- 참조 화자의 음성과 운율에 조건화하기 위한 스타일적응 정규화 메커니즘을 도입합니다.
- 적대적 판별기와 스타일 프로토타입을 통한 메타러닝으로 미지의 화자에 대한 적응을 강화합니다.
- 본 화자 및 미지의 화자 작업에서 최첨단 성능을 입증하고, 초단 참조 오디오 상황을 포함합니다.
제안 방법
- 참조 음성에서 추출된 스타일 벡터의 이익과 바이어스를 맞추기 위해 StyleSpeech에 Style-Adaptive Layer Normalization(SALN)을 제안합니다.
- 스타일 프로토타입과 스타일 디스크리미네이터를 갖춘 메타러닝을 통해 StyleSpeech를 Meta-StyleSpeech로 확장하여 한 샷 적응이 가능하도록 합니다.
- 참조 음성에서 스타일 벡터를 추출하기 위해 멜 스타일 인코더를 사용하고 SALN을 FastSpeech2 기반 생성기의 FFT 기반 음소 인코더와 멜-스펙트로그램 디코더에 feed합니다.
- Seen 화자에 대한 재구성 손실과 Unseen 화자 적응을 위한 두 디스크리미네이터의 대립 손실(LS-GAN) 및 스타일 프로토타입 분류 목적을 포함한 학습을 수행합니다.
- 에피소드 학습은 각 에피소드에서 지원/쿼리 분할을 시뮬레이션하여 unseen 화자에 대한 일반화 성능을 향상합니다.
실험 결과
연구 질문
- RQ1StyleSpeech가 멋진 다중 화자 음성을 합성하고 단일 짧은 참조 오디오를 사용해 새로운 화자에 적응할 수 있는가?
- RQ2디스크리미네이터를 활용한 메타러닝이 비메타 학습 기반 강건성 대비 unseen 화자에 대한 적응 품질을 향상시키는가?
- RQ3참조 음성의 길이가 unseen 화자의 적응 정확도와 음성 유사도에 어떤 영향을 미치는가?
- RQ4스타일 디스커리미네이터, 음소 디스커미네이터 및 스타일 프로토타입의 unseen 화자 적응 기여도는 무엇인가?
- RQ5seen 및 unseen 조건에서 생성된 음성이 대상 화자의 음성에 얼마나 근접하는지 객관적 및 주관적 지표에서 어느 수준인가?
주요 결과
- StyleSpeech는 seen 화자에 대해 MOS가 더 높고 MCD/WER이 baselines보다 낮다.
- Meta-StyleSpeech는 seen 화자에 대해 평가된 모델들 중 최상의 성능을 달성한다.
- unseen 화자에 대해서는 Meta-StyleSpeech가 MOS, MCD, WER 및 음성 유사도에서 baselines를 능가한다.
- 1초 미만의 참조 오디오에서도 Meta-StyleSpeech로의 적응이 크게 개선되며, 모든 참조 길이에서 StyleSpeech보다 우수하다.
- ablation 연구에서 음소 디스커리미네이터, 스타일 디스커리미네이터 및 스타일 프로토타입의 unseen 화자 적응 중요성이 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.