Skip to main content
QUICK REVIEW

[논문 리뷰] Building a mixed-lingual neural TTS system with only monolingual data

Liumeng Xue, Wei Song|arXiv (Cornell University)|2019. 04. 12.
Natural Language Processing Techniques참고 문헌 25인용 수 4
한 줄 요약

이 논문은 목표 화자로부터의 단일 언어 데이터만을 사용하여 중국어-영어 혼합 어조 음성 합성(TTS) 시스템을 제안한다. 디코더에 평균 음성 모델과 화자 임베딩을 통합하고, 발음 정보를 반영한 어텐션을 활용하여 화자 일관성과 자연스러움을 달성한다. 이는 단일 언어 데이터만으로도 발음 및 화자 표현을 전략적으로 모델링할 경우 고품질의 혼합 어조 음성 합성이 가능함을 보여준다.

ABSTRACT

When deploying a Chinese neural text-to-speech (TTS) synthesis system, one of the challenges is to synthesize Chinese utterances with English phrases or words embedded. This paper looks into the problem in the encoder-decoder framework when only monolingual data from a target speaker is available. Specifically, we view the problem from two aspects: speaker consistency within an utterance and naturalness. We start the investigation with an Average Voice Model which is built from multi-speaker monolingual data, i.e. Mandarin and English data. On the basis of that, we look into speaker embedding for speaker consistency within an utterance and phoneme embedding for naturalness and intelligibility and study the choice of data for model training. We report the findings and discuss the challenges to build a mixed-lingual TTS system with only monolingual data.

연구 동기 및 목표

  • 혼합 어조 TTS 시스템이 단일 목표 화자로부터의 단일 언어 데이터만으로 구축될 수 있는지 조사하기.
  • 언어 전환 시기에 화자 일관성을 유지하는 데에 화자 임베딩의 효과를 평가하기.
  • 발음 임베딩이 혼합 어조 음성의 자연스러움과 이해도에 기여하는지 검토하기.
  • 고품질의 혼합 어조 음성 합성을 위해 단일 언어 학습 데이터만으로도 충분한지, 또는 혼합 어조 데이터가 필수적인지 판단하기.
  • 모델 아키텍처 선택 사항, 예를 들어 화자 임베딩의 위치와 어텐션 메커니즘의 영향이 음성 합성 품질에 미치는 영향 분석하기.

제안 방법

  • 다양한 화자로부터의 중국어 및 영어 단일 언어 데이터를 기반으로 평균 음성 모델(AVM)을 학습하여 공통 음성 공간을 확립한다.
  • 화자 임베딩을 디코더 입력에 통합함으로써 화자 신원을 더 잘 제어하고 언어 전환 시 일관성을 향상시킨다 (SE-DEC).
  • 추가적인 컨텍스트 벡터(PECV)와 잔차 인코더(RES)를 활용해 발음 정보를 반영한 어텐션을 구현함으로써 정렬과 컨텍스트 표현을 향상시킨다.
  • 세 가지 데이터 구성으로 모델을 학습한다: 중국어 단일 언어(CORPUS-MAN), 영어 단일 언어(CORPUS-ENG), 목표 화자로부터의 혼합 어조 음성(CORPUS-MIX).
  • 청취 테스트를 통해 자연스러움과 화자 일관성 측면에서 AB 선호도 평가를 실시하여 성능을 평가한다.
  • SE-DEC를 Retrain-AVM과 비교하고, 학습 데이터 구성이 모델 일반화 능력에 미치는 영향을 분석한다.

실험 결과

연구 질문

  • RQ1단일 언어 데이터만으로 학습된 인코더가 중국어 및 영어 발음 기호에 대해 의미 있고 구분 가능한 음성 표현을 학습할 수 있는가?
  • RQ2화자 임베딩의 위치(인코더 대비 디코더)가 혼합 어조 문장에서 화자 일관성에 어떤 영향을 미치는가?
  • RQ3발음 임베딩이 혼합 어조 음성의 어텐션 정렬 및 자연스러움과 이해도를 향상시킬 수 있는가?
  • RQ4단일 언어 데이터만으로도 견고한 혼합 어조 TTS 시스템을 학습시킬 수 있는가, 아니면 혼합 어조 데이터가 최적의 성능을 위해 필수적인가?
  • RQ5학습 데이터 선택(중국어 전용, 영어 전용, 또는 혼합)이 모델의 다국어 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 다양한 화자로부터의 단일 언어 데이터를 기반으로 학습된 평균 음성 모델은 이중 언어 데이터 없이도 의미 있는 발음 표현을 학습하고 중국어 및 영어 발음 기호를 구분한다.
  • 디코더 입력에 화자 임베딩을 통합한 SE-DEC가 인코더 기반 통합 방식보다 언어 전환 시 화자 일관성을 더 잘 유지한다.
  • 혼합 어조 학습 데이터(CORPUS-MIX)는 단일 언어 데이터보다 혼합 어조 음성 합성에 더 유리하지만, 단일 언어 데이터 역시 만족스러운 결과를 제공한다.
  • 모든 세 언어에서 잔차 인코더(RES)를 사용한 SE-DEC-RES가 추가 컨텍스트 벡터(PECV)를 사용한 SE-DEC-PECV보다 더 자연스러운 음성 합성을 달성했으며, 화자 일관성은 유사하게 유지된다.
  • 청취 테스트 결과, 중국어 데이터만으로 학습한 모델이 중국어 단일 언어 음성 합성에서 선호되며, 영어 데이터가 없을 경우 중국어 데이터가 영어 단일 언어 음성 합성에서도 혼합 어조 데이터를 능가하는 성능을 보였다.
  • 발음 정보를 반영한 어텐션은 혼합 어조 문장에서 자연스러움과 화자 일관성을 크게 향상시키며, 특히 영어 단어와 인접한 중국어 단어의 음운 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.