[논문 리뷰] Cross-Lingual Text-to-Speech Using Multi-Task Learning and Speaker Classifier Joint Training
이 논문은 다국어 텍스트-음성 합성(TTS) 시스템에서 교차 언어적 화자 유사도를 향상시키기 위해 다중 작업 학습(MTL)과 화자 분류기의 공동 학습 프레임워크를 제안한다. 단일 언어 화자 데이터만 이용 가능한 상황에서, 멀티라틴 트랜스포머 TTS 모델과 x-vector 화자 분류기를 함께 학습하고, 근사 평행 스케줄링 샘플링 방법을 사용함으로써, 다양한 언어에서 볼 수 있는 화자와 볼 수 없는 화자 모두에서 유사도가 크게 향상된다. 객관적 및 주관적 평가를 통해 일관된 성능 향상이 확인되었다.
In cross-lingual speech synthesis, the speech in various languages can be synthesized for a monoglot speaker. Normally, only the data of monoglot speakers are available for model training, thus the speaker similarity is relatively low between the synthesized cross-lingual speech and the native language recordings. Based on the multilingual transformer text-to-speech model, this paper studies a multi-task learning framework to improve the cross-lingual speaker similarity. To further improve the speaker similarity, joint training with a speaker classifier is proposed. Here, a scheme similar to parallel scheduled sampling is proposed to train the transformer model efficiently to avoid breaking the parallel training mechanism when introducing joint training. By using multi-task learning and speaker classifier joint training, in subjective and objective evaluations, the cross-lingual speaker similarity can be consistently improved for both the seen and unseen speakers in the training set.
연구 동기 및 목표
- 단일 언어 화자 데이터만 이용 가능한 상황에서 교차 언어적 텍스트-음성 합성에서 낮은 화자 유사도 문제를 해결하기 위해.
- 특히 볼 수 없는 화자에 대해 합성된 교차 언어 음성과 실재 음성 기록 간의 화자 유사도를 향상시키기 위해.
- 다국어 데이터나 화자 인코더 기반 시스템을 요구하지 않고도 화자 표현을 향상시키는 학습 프레임워크를 개발하기 위해.
- 제한된 데이터로 새로운 볼 수 없는 화자를 위한 효과적인 모델 피팅을 가능하게 하되, 높은 화자 유사도를 유지하기 위해.
제안 방법
- 다국어 트랜스포머 TTS 모델에 화자 및 언어 정체성 분류기를 추가하는 다중 작업 학습(MTL) 프레임워크를 도입하여, 교차 엔트로피 손실을 통해 적절한 임bedding 학습을 유도한다.
- 동일한 화자에 대해 원본 기록 음성과 합성된 교차 언어 음성 간의 x-vector 거리를 최소화하도록 TTS 모델과 x-vector 화자 분류기를 공동으로 학습한다.
- 공동 학습 중 추론 모드의 생성이 필요하더라도, 평행 학습 효율성을 유지하기 위해 근사 평행 스케줄링 샘플링 기법을 적용한다.
- 화자 및 언어 특성을 모델링하기 위해 트랜스포머 TTS 프레임워크 내에서 고정 차원의 화자 임베딩과 언어 임베딩을 사용한다.
- 새로운 저자원 화자에 대해 피팅할 때 과적합을 방지하기 위해 화자 확장 기간 동안 언어 균형 학습을 적용한다.
- TTS 모델이 다양한 언어에서 화자의 정체성을 유지하는 음성을 생성하도록 유도하기 위해 x-vector 시스템을 미분 가능 목적함수로 활용한다.
실험 결과
연구 질문
- RQ1다국어 데이터나 화자 인코더를 요구하지 않고도 다중 작업 학습이 교차 언어적 TTS에서 화자 유사도를 향상시킬 수 있는가?
- RQ2x-vector 화자 분류기와의 공동 학습은 볼 수 있는 화자와 볼 수 없는 화자 모두에서 교차 언어적 화자 유사도 향상에 얼마나 효과적인가?
- RQ3학습 중 추론 모드의 생성이 필요한 상황에서도, 공동 최적화를 가능하게 하면서 학습 효율성을 유지할 수 있는가?
- RQ4다양한 학습 데이터 크기를 가진 여러 언어에서 이 방법이 화자 유사도 향상에 어느 정도 기여하는가?
- RQ5제한된 데이터로 새로운 볼 수 없는 화자에 대해 일반화할 수 있으며, 높은 화자 유사도를 유지할 수 있는가?
주요 결과
- 보이는 화자에 대해 교차 언어 합성에서 +MTL+Joint 모델은 코사인 거리를 평균 34% 감소시켰으며, 특히 저자원 언어에서 가장 큰 향상이 관찰되었다.
- ~9분의 데이터를 가진 새로운 zh-CN 화자에 대해, 유사도 MOS는 기준 모델의 3.99 ± 0.09에서 4.21 ± 0.07로 상승하여 주관적 향상이 뚜렷하게 확인되었다.
- 객관적 평가에서 새로운 zh-CN 화자에 대해 코사인 거리는 여러 언어에서 0.096에서 0.092로 감소하여 일관된 성능 향상이 나타났다.
- ~5분의 데이터를 가진 새로운 en-GB 화자에 대해, 목표 언어에서 코사인 거리는 0.088에서 0.083으로 감소했고, 교차 언어 설정에서는 0.224에서 0.164로 감소하였다.
- x-vector 코사인 거리와 주관적 유사도 MOS 간에 강한 상관관계가 존재하여, 화자 유사도의 객관적 측정 지표로의 활용이 타당함을 검증하였다.
- 교차 언어 유사도 향상이 내언어 유사도 향상보다 더 크며, 이는 교차 언어 손실 목적함수가 효과적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.