[논문 리뷰] AdaDurIAN: Few-shot Adaptation for Neural Text-to-Speech with DurIAN
AdaDurIAN는 멀티스피커 평균 모델을 기반으로 한 개선된 DurIAN 아키텍처를 사용하여, 단 몇 분의 단일어 데이터만으로도 고품질, 자연스럽고 화자 유사도가 높은 신경망 음성합성 텍스트-음성 변환(TTS)을 위한 few-shot 적응 방법을 제안한다. 콘텐츠 인코더를 고정하고 화자 임베딩과 디코더만 미세조정함으로써, 기존 Tacotron 유사 모델 대비 뛰어난 자연스러움(3분 데이터로 MOS 4.21)과 견고한 다국어 간 성능을 달성한다.
This paper investigates how to leverage a DurIAN-based average model to enable a new speaker to have both accurate pronunciation and fluent cross-lingual speaking with very limited monolingual data. A weakness of the recently proposed end-to-end text-to-speech (TTS) systems is that robust alignment is hard to achieve, which hinders it to scale well with very limited data. To cope with this issue, we introduce AdaDurIAN by training an improved DurIAN-based average model and leverage it to few-shot learning with the shared speaker-independent content encoder across different speakers. Several few-shot learning tasks in our experiments show AdaDurIAN can outperform the baseline end-to-end system by a large margin. Subjective evaluations also show that AdaDurIAN yields higher mean opinion score (MOS) of naturalness and more preferences of speaker similarity. In addition, we also apply AdaDurIAN to emotion transfer tasks and demonstrate its promising performance.
연구 동기 및 목표
- 새로운 화자에 대해 매우 제한된 단일어 데이터로 고품질 신경망 TTS 시스템을 훈련하는 데 도전하는 것.
- 지속적인 주의 집중과 공통된 화자 독립적 콘텐츠 인코더를 활용하여 소수의 예시에서 화자 적응의 자연스러움과 견고성을 향상시키는 것.
- 안정성이 떨어지는 주의 기반 엔드 투 엔드 TTS 모델의 문제를 극복하고, 단 몇 분의 데이터만으로도 새로운 화자 음성으로 유창한 다국어 음성합성을 가능하게 하는 것.
- 모델의 성능을 화자 적응 및 소수의 예시 감정 전이 작업에서 평가하는 것.
제안 방법
- DurIAN 기반의 공통된 화자 독립적 콘텐츠 인코더를 사용하여, 음소 및 억양/강세 시퀀스에 대해 처리하는 few-shot 적응 프레임워크인 AdaDurIAN을 제안한다.
- 콘텐츠 인코더를 고정하고 화자 임베딩과 디코더 헤드만 미세조정함으로써 훈련의 불안정성과 발음 오류를 감소시킨다.
- 스트리밍 추론을 위해 시간 지연이 있는 LSTM 포스트넷을 도입하여 글로벌 CBHG 모듈을 대체함으로써 멜스펙트로그램의 매끄러움을 향상시킨다.
- 지속 시간 감시를 통한 윈도우 기반 콘텐츠 기반 주의를 도입하여 정렬의 견고성 향상과 주의 집중 붕괴 감소를 달성한다.
- 멀티스피커 평균 모델을 훈련하고, 각 화자당 1~20분의 단일어 데이터만으로 미세조정을 통해 적응시킨다.
- 동일한 적응 전략을 감정 전이 작업에 적용하여, 최소한의 데이터로 중립 기반 모델에서 감정을 전이한다.
실험 결과
연구 질문
- RQ1단 한 개의 평균 TTS 모델이 단 몇 분의 단일어 데이터만으로도 높은 자연스러움과 화자 유사도를 유지하면서 새로운 화자에 효과적으로 적응할 수 있는가?
- RQ2콘텐츠 인코더를 고정하고 화자 임베딩과 디코더만 미세조정할 경우, 소수의 예시 설정에서 발음 정확도와 정렬의 견고성에 어떤 영향을 미치는가?
- RQ3대상 화자가 목표 언어에서 사전 데이터가 없는 상황에서 AdaDurIAN이 다국어 음성합성에 얼마나 잘 일반화되는가?
- RQ4AdaDurIAN은 소수의 예시 감정 전이 작업에 성공적으로 적용될 수 있으며, 다양한 감정 스타일 간 성능은 어떻게 비교되는가?
- RQ5AdaDurIAN의 성능은 MOS, 화자 유사도, 다국어 유창성 측면에서 표준 Tacotron 유사 모델과 비교해 볼 때 어떻게 다른가?
주요 결과
- 단지 3분의 훈련 데이터로도 AdaDurIAN은 중국어 모국어 화자에 대해 MOS 4.21을 달성하였으며, 실제 녹음 기준 MOS보다 0.2 미만 낮게 기록되었다.
- 중국어 데이터가 전혀 없는 영어 모국어 화자에게도, 단 1분의 데이터로 중국어 문장을 재생할 때 MOS 3.90을 기록하여 강력한 다국어 일반화 능력을 입증했다.
- 화자 유사도 선호도 테스트에서 SMA 기준 모델보다 AdaDurIAN이 특히 영어 문장에서 중국어 화자에 대해 유의미한 격차를 보이며 뛰어난 성능을 보였다.
- 소수의 예시 F2F 감정 전이에서 평균 감정 분류 정확도는 64%를 기록했고, F2M 전이에서는 52%를 기록하여 최소한의 데이터로도 감정 전이에 유망한 성능을 보였다.
- 주관적 평가 결과, AdaDurIAN은 기준 Tacotron 유사 모델보다 더 자연스럽고 화자 유사도에 더 높은 선호도를 보였다.
- 콘텐츠 인코더를 고정하고 화자 임베딩과 디코더만 미세조정함으로써, 발음 오류와 주의 집중 붕괴를 크게 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.