[논문 리뷰] ASR data augmentation in low-resource settings using cross-lingual multi-speaker TTS and cross-lingual voice conversion
이 논문은 저자원 대상 언어에서 단일 실존 음성 데이터만으로도 효과적인 ASR 모델을 훈련시킬 수 있도록, 다국어 다화자 TTS와 다국어 음성 변환을 활용한 새로운 ASR 데이터 증강 기법을 제안한다. 이 방법은 포르투갈어(pt-BR)에서 33.96%, 러시아어(ru-RU)에서 36.59%의 WER 감소를 이끌어내어, 고품질의 합성 데이터가 대규모 인간 음성 데이터셋으로 훈련된 모델과 맞먹는다는 것을 입증한다.
We explore cross-lingual multi-speaker speech synthesis and cross-lingual voice conversion applied to data augmentation for automatic speech recognition (ASR) systems in low/medium-resource scenarios. Through extensive experiments, we show that our approach permits the application of speech synthesis and voice conversion to improve ASR systems using only one target-language speaker during model training. We also managed to close the gap between ASR models trained with synthesized versus human speech compared to other works that use many speakers. Finally, we show that it is possible to obtain promising ASR training results with our data augmentation method using only a single real speaker in a target language.
연구 동기 및 목표
- 다양한 화자 데이터셋을 확보하기 어려운 저자원 환경에서 효과적인 ASR 시스템을 훈련하는 데 도전한다.
- 합성 데이터 증강을 통해 단일 실존 화자만으로도 경쟁력 있는 ASR 모델을 훈련시킬 수 있는지 탐구한다.
- 다국어 다화자 TTS와 제로샷 음성 변환을 활용해 다양한 실감적인 훈련 데이터를 생성할 수 있는지 탐색한다.
- 저자원 환경에서 합성 데이터로 훈련된 모델과 인간 음성 데이터로 훈련된 모델 간의 성능 격차를 해소한다.
- 최소한의 데이터 요구 조건으로 멸종 위험에 처한 언어나 자원이 부족한 언어에 대해 실용적인 ASR 시스템 구현을 가능하게 한다.
제안 방법
- 사전 훈련된 다국어 다화자 TTS 모델(YourTTS)을 활용해 대상 언어 화자 한 명의 음성으로부터 합성 음성을 생성한다.
- 다국어 제로샷 음성 변환을 적용해 합성 음성을 1,248명의 영어 화자 음성으로 이식하여 다양한 합성 훈련 데이터를 생성한다.
- 음성 변환의 소스로 영어를 사용하고, 대상 언어(포르투갈어 또는 러시아어)에서 단일 실존 화자 음성으로만 TTS 모델을 훈련시킨다.
- 두 가지 합성 데이터셋을 생성한다: GEN_TTS(대상 화자로부터의 합성 음성)와 GEN_VC(다른 화자로의 음성 변환된 음성).
- 원본 단일 화자 데이터셋과 GEN_TTS 및 GEN_VC 데이터를 결합하여 ASR 훈련 데이터를 증강한다.
- 증강된 데이터로 엔드 투 엔드 ASR 모델을 훈련하고, pt-BR 및 ru-RU의 Common Voice 테스트 세트에서 성능을 평가한다.

실험 결과
연구 질문
- RQ1단일 대상 언어 화자로 훈련된 TTS 모델이 음성 변환과 조합했을 때 ASR 성능 향상에 기여할 수 있는가?
- RQ2대상 언어에서 단일 실존 화자만으로도 저자원 환경에서 경쟁력 있는 ASR 성능을 달성할 수 있는가?
- RQ3저자원 환경에서 합성 데이터로 훈련된 ASR 모델의 성능가 인간 음성 데이터로 훈련된 모델의 성능는 어떻게 비교되는가?
- RQ4다국어 다화자 TTS와 다국어 음성 변환의 조합이 기존의 데이터 증강 기법보다 저자원 ASR에서 더 우수한 성능을 내는가?
- RQ5이 방법은 Wav2Vec 2.0 사전 훈련에 포함된 언어(예: 포르투갈어)와 포함되지 않은 언어(예: 러시아어) 모두에 일반화 가능한가?
주요 결과
- 제안된 방법은 단일 실존 화자만으로 훈련된 기준 모델의 WER 63.90%를 포르투갈어(pt-BR)에서 33.96%로 감소시켜 상대적 향상률 29.94%를 달성했다.
- 러시아어(ru-RU)의 경우 WER가 74.02%에서 36.59%로 감소하여 상대적 향상률 37.43%를 기록했다.
- 합성 데이터(GEN_TTS + GEN_VC)로 훈련된 모델는 단일 실존 화자만을 사용했음에도 불구하고 ru-RU에서 최신 기술(SOTA) 수준의 성능을 달성했다.
- 이 방법은 Wav2Vec 2.0 사전 훈련에 포함된 언어(pt-BR)와 포함되지 않은 언어(ru-RU) 모두에서 유의미한 성능 향상을 보여 일반화 능력을 입증했다.
- 합성 데이터로 훈련된 모델과 인간 음성 데이터로 훈련된 모델 간의 성능 격차를 크게 줄였으며, pt-BR에서 33.96%의 WER를 달성하여 자율 사전 훈련 없이도 이전 SOTA를 초월했다.
- 상한선(공통 음성 데이터 + TTS 데이터셋)은 pt-BR에서 20.39%, ru-RU에서 24.80%의 WER를 기록했으며, 제안된 방법이 경쟁력은 있지만 전체 데이터 성능에 여전히 격차가 존재함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.