[논문 리뷰] Cross-lingual Multi-speaker Text-to-speech Synthesis for Voice Cloning without Using Parallel Corpus for Unseen Speakers
이 논문은 병렬 데이터가 필요 없이 영어 및 중국어에서 본인의 모국어 및 외국어 사용자에 대해 고품질의 음성 클로닝을 가능하게 하는 다국어 다화자 음성 합성 시스템을 제안한다. x-vector 화자 임베딩, 언어 임베딩, 음성 강조/강세 임베딩에 조건을 두고, 화자 임베딩의 L2-정규화 또는 화이트닝을 통해 모델은 볼륨이 높고 자연스러운 음성과 높은 화자 유사도를 달성하며, 특히 중국어(광둥어) 데이터로 훈련된 WaveNet 음성 생성기로 다국어 간 일반화가 가능하다.
We investigate a novel cross-lingual multi-speaker text-to-speech synthesis approach for generating high-quality native or accented speech for native/foreign seen/unseen speakers in English and Mandarin. The system consists of three separately trained components: an x-vector speaker encoder, a Tacotron-based synthesizer and a WaveNet vocoder. It is conditioned on 3 kinds of embeddings: (1) speaker embedding so that the system can be trained with speech from many speakers will little data from each speaker; (2) language embedding with shared phoneme inputs; (3) stress and tone embedding which improves naturalness of synthesized speech, especially for a tonal language like Mandarin. By adjusting the various embeddings, MOS results show that our method can generate high-quality natural and intelligible native speech for native/foreign seen/unseen speakers. Intelligibility and naturalness of accented speech is low as expected. Speaker similarity is good for native speech from native speakers. Interestingly, speaker similarity is also good for accented speech from foreign speakers. We also find that normalizing speaker embedding x-vectors by L2-norm normalization or whitening improves output quality a lot in many cases, and the WaveNet performance seems to be language-independent: our WaveNet is trained with Cantonese speech and can be used to generate Mandarin and English speech very well.
연구 동기 및 목표
- 병렬 훈련 데이터가 필요 없이 영어 및 중국어에서 모국어 및 외국어 사용자에 대해 고품질의 음성 합성 기능을 제공하기 위해.
- 각 화자당 제한된 도메인 데이터로도 알려지지 않은 화자에 대해 음성 클로닝을 지원하기 위해.
- 언어별 및 억양 특화 임베딩을 통해 음성의 자연스러움과 화자 유사도를 향상시키기 위해.
- 화자 임베딩 정규화(L2-노름, 화이트닝)가 음성 합성 품질과 화자 유사도에 미치는 영향을 조사하기 위해.
- 한국어가 아닌 언어(Cantonese)로 훈련된 WaveNet 음성 생성기가 다른 언어(Mandarin, English)에서 음성을 생성하는 데 효과적으로 일반화되는지 평가하기 위해.
제안 방법
- 시스템은 세 개의 별도로 훈련된 구성 요소로 구성된 모듈식 파이프라인을 사용한다: x-vector 화자 인식기, Tacotron 기반 TTS 합성기, WaveNet 음성 생성기.
- TTS 모델은 세 가지 유형의 임베딩에 조건을 두며: 화자 임베딩(다양한 화자 학습을 위해), 언어 임베딩(공통된 음소 입력을 사용), 음성 강조/강세 임베딩(특히 어조어인 중국어와 같은 언어에서 억양을 향상시키기 위해).
- 화자 임베딩은 L2-노름 또는 화이트닝을 통해 정규화되어 음성 합성 품질과 화자 유사도를 향상시킨다.
- WaveNet 음성 생성기는 광둥어 음성 데이터로 훈련되었으며, 중국어 및 영어 모두에서 고해상도 음성을 생성하는 데 사용되어 언어 간 일반화 능력을 입증한다.
- 소량의 참조 오디오(몇 초)만으로도 알려지지 않은 화자에 대한 음성 임베딩에 조건을 두어 제로샷 음성 클로닝을 가능하게 한다.
- 시스템은 공개된 데이터셋인 영어용 LibriSpeech 및 중국어용 SurfingTech를 사용해 훈련되어 재현 가능성을 확보한다.
실험 결과
연구 질문
- RQ1병렬 훈련 데이터 없이 다국어 다화자 TTS 시스템이 본인 및 외국어 사용자에 대해 고품질의 모국어 및 외국어 음성 합성을 가능하게 할 수 있는가?
- RQ2화자 임베딩 정규화(L2-노름, 화이트닝)가 합성 음성의 이해 가능성, 자연스러움, 화자 유사도에 어떤 영향을 미치는가?
- RQ3한국어가 아닌 언어(Cantonese)로 훈련된 WaveNet 음성 생성기가 다른 언어(Mandarin, English)에서 고품질의 음성을 효과적으로 생성할 수 있는가?
- RQ4외국어 발음이 있는 음성의 화자 유사도가 모국어 음성과 비교해 떨어지지 않으며, 특히 알려지지 않은 외국어 화자에게도 안정적인가?
- RQ5어조어인 중국어와 같은 언어에서 어조 및 강세 임베딩의 포함이 음성의 자연스러움을 크게 향상시키는가?
주요 결과
- x-vector 화자 임베딩의 화이트닝이 화자 유사도와 자연스러움을 크게 향상시키며, 알려지지 않은 중국어 어원 화자에 대해 4.92 MOS, 알려지지 않은 영어 어원 화자에 대해 4.92 MOS를 기록한다.
- 화자 임베딩의 L2-정규화는 이해 가능성과 품질을 향상시키며, 알려지지 않은 영어 어원 화자에 대해 4.92 MOS, 알려지지 않은 중국어 어원 화자에 대해 4.71 MOS를 기록한다.
- 화이트닝된 임베딩을 사용할 경우, 외국어 발음이 있는 음성(FNE 및 FNM)의 화자 유사도가 중국어 어원 화자(NM)보다 높으며, 이는 발음과 화자 변동성에 대한 강건성을 시사한다.
- 광둥어로 훈련된 WaveNet 음성 생성기는 중국어 및 영어 모두에서 고품질의 음성을 생성하며, 음성 생성기의 언어 간 일반화 능력을 입증한다.
- 외국어 발음 음성의 이해 가능성과 자연스러움은 모국어 음성보다 낮지만, L2-정규화는 외국어-모국어 영어 음성의 이해 가능성 점수를 2.08(정규화 없음)에서 4.92(L2-정규화)로 향상시킨다.
- 화이트닝이 가장 우수한 성능을 보이며, 알려지지 않은 화자에 대해 높은 화자 유사도(3.81–4.08 MOS)를 달성하여 언어 간 일반화 능력이 뛰어나다는 것을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.