[논문 리뷰] CUHK-EE Voice Cloning System for ICASSP 2021 M2VoC Challenge
이 논문은 ICASSP 2021 M2VoC 챌린지에서 CUHK-EE 음성 클로닝 시스템을 제시하며, 히브리드 Tacotron2 및 DurIAN 음성 모델과 Hifigan 보코더를 사용하여 엔드 투 엔드 음성 클로닝을 구현한다. 시스템은 다중 발화자 학습, 100개의 발화를 활용한 타겟 발화자 적응, 그리고 지속 시간 예측기로 강력한 발화자 유사도와 스타일 전이를 달성하며, 트랙 1b에서 발화자 유사도 3.8365 MOS, 스타일 유사도 3.6163 MOS를 기록하여 총 22개 팀 중 13위를 차지했다.
This paper presents the CUHK-EE voice cloning system for ICASSP 2021 M2VoC challenge. The challenge provides two Mandarin speech corpora: the AIShell-3 corpus of 218 speakers with noise and reverberation and the MST corpus including high-quality speech of one male and one female speakers. 100 and 5 utterances of 3 target speakers in different voice and style are provided in track 1 and 2 respectively, and the participants are required to synthesize speech in target speaker's voice and style. We take part in the track 1 and carry out voice cloning based on 100 utterances of target speakers. An end-to-end voicing cloning system is developed to accomplish the task, which includes: 1. a text and speech front-end module with the help of forced alignment, 2. an acoustic model combining Tacotron2 and DurIAN to predict melspectrogram, 3. a Hifigan vocoder for waveform generation. Our system comprises three stages: multi-speaker training stage, target speaker adaption stage and target speaker synthesis stage. Our team is identified as T17. The subjective evaluation results provided by the challenge organizer demonstrate the effectiveness of our system. Audio samples are available at our demo page: https://daxintan-cuhk.github.io/CUHK-EE-system-M2VoC-challenge/ .
연구 동기 및 목표
- 제한된 데이터로 타겟 발화자의 음성과 스타일을 재현할 수 있는 강력한 엔드 투 엔드 음성 클로닝 시스템을 개발하는 것.
- 저자원 음성 클로닝 환경에서 Tacotron2와 DurIAN을 조합함으로써 보다 향상된 유사도와 정렬 성능을 달성할 수 있는지 조사하는 것.
- 외부 데이터의 포함 여부가 제로샷 또는 희소 샘플 설정에서 음성 클로닝 성능에 미치는 영향을 평가하는 것.
- 제약 조건이 있는 학습 환경에서도 높은 발화자 유사도와 스타일 전이 품질을 달성하는 것.
제안 방법
- 텍스트 및 음성 프론트엔드 모듈은 pypinyin를 사용해 문자에서 음소로의 변환을 수행하고, 몬트리올 강제 정렬기(Montreal Forced Aligner, MFA)를 활용해 음소 수준의 강제 정렬을 수행하여 참값 지속 시간을 추출한다.
- 음성 모델은 Tacotron2와 DurIAN을 결합하며, 음소 시퀀스와 참값 지속 시간을 기반으로 훈련된 명시적 지속 시간 예측기를 사용하여 정렬 및 유사도를 향상시킨다.
- 사전 훈련된 Hifigan 보코더는 타겟 발화자 적응 단계에서 타겟 음성 모델의 출력 멜스펙트로그램과 참값 웨이브폼을 사용하여 미세조정된다.
- 시스템은 다중 발화자 학습, 100개의 발화를 활용한 타겟 발화자 적응, 그리고 트랙 1a에서는 외부 데이터 없이, 트랙 1b에서는 외부 데이터를 사용하여 타겟 발화자 합성으로 구성된 세 단계 파이프라인을 따르며 진행된다.
- 지속 시간 예측기는 양방향 LSTM과 선형층을 사용하며, 음소 시퀀스에서 프레임 수준의 지속 시간을 예측하기 위해 평균 제곱오차(MSE) 손실을 적용한다.
- 보코더 적응은 타겟 발화자 적응 단계에서 음성 모델의 출력 멜스펙트로그램과 해당 참값 웨이브폼을 사용해 총 3000 스텝 동안 수행된다.
실험 결과
연구 질문
- RQ1제한된 타겟 발화자 데이터로 소수의 샘플만을 사용하는 경우, 히브리드 Tacotron2와 DurIAN 음성 모델이 소수 샘플 음성 클로닝에 얼마나 효과적인가?
- RQ2다중 발화자 TTS 시스템을 100개의 발화만으로 미세조정할 때, 발화자 및 스타일 유사도를 얼마나 잘 유지할 수 있는가?
- RQ3외부 데이터의 포함 여부가 음성 품질, 발화자 유사도, 스타일 전이 측면에서 음성 클로닝 성능에 유의미한 영향을 미치는가?
- RQ4강제 정렬에 기반한 지속 시간 예측기가 엔드 투 엔드 TTS 시스템에서 음성 클로닝의 정렬 및 유사도 향상에 얼마나 효과적인가?
주요 결과
- 트랙 1a에서 시스템은 음성 품질에 대해 평균 평가 점수(MOS) 3.5845 ± 0.0563을 기록하여 총 18개 시스템 중 11위를 차지했다.
- 트랙 1b에서 외부 데이터를 활용한 결과, 음성 품질에 대해 MOS 3.9630 ± 0.0468를 기록하여 총 22개 팀 중 13위를 기록했다.
- 발화자 유사도 측면에서, 트랙 1a에서는 3.7470 ± 0.0499(18개 중 10위), 트랙 1b에서는 3.8365 ± 0.0499(22개 중 13위)를 기록했다.
- 스타일 유사도 측면에서, 트랙 1a에서는 3.6840 ± 0.0410(18개 중 12위), 트랙 1b에서는 3.6163 ± 0.0417(22개 중 15위)를 기록했다.
- 결과는 시스템이 합리적인 성능을 보이고 있음에도 불구하고, 특히 발화자 및 스타일 유사도 측면에서 향상 여지가 여전히 크다는 것을 시사한다.
- 트랙 1b에서 외부 데이터의 활용은 모든 MOS 지표에서 유의미한 향상을 가져왔으며, 이는 저자원 음성 클로닝 환경에서 외부 데이터의 가치를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.