[논문 리뷰] Cross-lingual Multispeaker Text-to-Speech under Limited-Data Scenario
이 논문은 타코트론2 기반의 다국어 다화자 음성합성 시스템을 제안하며, 공유된 음소 표현과 별도의 언어 토큰 및 화자 임베딩을 사용하여 영어와 중국어 간 고음질, 유창하고 이해하기 쉬운 음성합성을 가능하게 한다. 이는 다국어를 구사하지 않는 화자도 비모국어를 자연스럽게 발화할 수 있도록 한다. 주요 기여는 이중 언어 데이터셋으로 훈련된 경우 제한된 데이터 조건에서도 강력한 다국어 음성합성을 가능하게 하여, 화자 정체성이 유지된 채로 자연스럽게 들리는 외국어 발음의 음성합성을 가능하게 한다.
Modeling voices for multiple speakers and multiple languages in one text-to-speech system has been a challenge for a long time. This paper presents an extension on Tacotron2 to achieve bilingual multispeaker speech synthesis when there are limited data for each language. We achieve cross-lingual synthesis, including code-switching cases, between English and Mandarin for monolingual speakers. The two languages share the same phonemic representations for input, while the language attribute and the speaker identity are independently controlled by language tokens and speaker embeddings, respectively. In addition, we investigate the model's performance on the cross-lingual synthesis, with and without a bilingual dataset during training. With the bilingual dataset, not only can the model generate high-fidelity speech for all speakers concerning the language they speak, but also can generate accented, yet fluent and intelligible speech for monolingual speakers regarding non-native language. For example, the Mandarin speaker can speak English fluently. Furthermore, the model trained with bilingual dataset is robust for code-switching text-to-speech, as shown in our results and provided samples.{https://caizexin.github.io/mlms-syn-samples/index.html}.
연구 동기 및 목표
- 영어와 중국어에서 제한된 데이터 조건 하에 고음질, 다화자, 다국어 음성합성 시스템을 가능하게 하기 위해.
- 저자원 환경에서 이중 언어 화자로부터 다국어 지식이 단일 언어 화자에게 전이될 수 있는지 조사하기 위해.
- 비모국어 언어를 위한 단일 언어 화자들의 음성만을 사용하여 자연스럽고 이해하기 쉬우며 자연스러운 외국어 발음의 코드스위칭 음성합성을 달성하기 위해.
- 비모국어 언어 음성합성 시 화자 정체성의 유지를 위해.
제안 방법
- 모델은 언어 토큰과 화자 임베딩에 대해 별도의 조건부 처리를 도입하여 언어와 화자 정체성을 독립적으로 제어할 수 있도록 타코트론2를 확장하였다.
- 공유된 음소 표현을 영어와 중국어 모두의 입력으로 사용하여, 서로 다른 철자 체계에도 불구하고 다국어 간 정렬을 가능하게 하였다.
- 이중 언어 훈련 데이터셋(DB-4)을 도입하여 훈련 중 이중 언어 화자에서 단일 언어 화자로 지식 전이가 가능하도록 하였다.
- 공유된 텍스트 인코더를 사용하고 언어별 조건부 처리를 통해 두 언어 모두 정확한 스펙트로그램을 생성하였다.
- 모델의 각 변종에서 생성된 스펙트로그램에 대해 WaveRNN 볼카디오를 미세조정하여 음성 품질을 향상시켰다.
- 특히 코드스위칭 시나리오에서의 언어 전환 시 부드러움을 평가하기 위해 어텐션 정렬을 분석하였다.
실험 결과
연구 질문
- RQ1제한된 데이터로 각 언어당 하나의 TTS 모델이 두 언어에서 여러 화자에 대해 고음질 음성합성을 생성할 수 있는가?
- RQ2이중 언어 데이터셋을 통합함으로써 단일 언어 화자에 대한 다국어 음성합성 성능이 향상되는가?
- RQ3단일 언어 화자들이 자신의 음성 임베딩만을 사용하여 비모국어 언어에서 자연스럽고 이해하기 쉬우며 자연스러운 외국어 발음을 내는가?
- RQ4영어와 중국어 간 코드스위칭 시 모델의 어텐션 메커니즘이 어떻게 작동하는가?
- RQ5저자원 환경에서 이중 언어 화자로부터 단일 언어 화자로 언어 관련 지식을 어느 정도 전이할 수 있는가?
주요 결과
- 이중 언어 데이터셋(DB-4)으로 훈련된 CLMS 모델은 중국어에 대해 자연스러움 MOS 4.11, 영어에 대해 3.97, 코드스위칭에 대해 3.99를 기록하여 모든 언어 유형에서 고음질 음성합성을 달성하였다.
- 다국어 음성합성에서 CLMS 모델은 영어에 대해 화자 유사도 MOS 4.17, 코드스위칭에 대해 4.22를 기록하여 화자 정체성의 강력한 유지가 가능함을 보여주었다.
- 다국어 음성합성의 이해도 MOS는 CLMS 모델에서 영어에 대해 4.47, 코드스위칭에 대해 4.59를 기록하여 명확하고 이해하기 쉬운 외국어 발음의 음성합성을 가능하게 하였다.
- 이중 언어 데이터 없이 훈련된 BLMS 모델은 영어에 대해 이해도 MOS 1.25로 매우 열악한 성능을 보였으며, 이는 이중 언어 데이터가 효과적인 다국어 전이를 위해 필수적임을 확인하였다.
- CLMS 모델의 어텐션 정렬은 언어 전환 시 매끄러운 전환을 보였고, 반면 BLMS 모델은 명확한 끊김 현상을 보여 다국어 모델링이 열악함을 시사하였다.
- 모델는 단일 언어 화자(예: 중국어 화자)가 다른 언어(영어)를 자연스럽고 외국어 발음이 나게 유창하고 이해하기 쉬운 방식으로 생성하는 데 성공하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.