[논문 리뷰] LRSpeech: Extremely Low-Resource Speech Synthesis and Recognition
LRSpeech는 사전 훈련, TTS와 ASR 간 이중 변환, 지식 정복을 통해 극도로 자원이 부족한 언어에서 텍스트-to-음성(TTS) 및 음성인식(ASR)을 위한 저자원 솔루션을 제안한다. 라이트반어어에 대해 단지 1.29시간의 쌍화된 데이터로 TTS는 98.6%의 이해 가능성과 3.65 MOS를 달성했고, ASR는 17.04%의 WER을 기록하여 산업적 적용 가능성을 입증한다.
Speech synthesis (text to speech, TTS) and recognition (automatic speech recognition, ASR) are important speech tasks, and require a large amount of text and speech pairs for model training. However, there are more than 6,000 languages in the world and most languages are lack of speech training data, which poses significant challenges when building TTS and ASR systems for extremely low-resource languages. In this paper, we develop LRSpeech, a TTS and ASR system under the extremely low-resource setting, which can support rare languages with low data cost. LRSpeech consists of three key techniques: 1) pre-training on rich-resource languages and fine-tuning on low-resource languages; 2) dual transformation between TTS and ASR to iteratively boost the accuracy of each other; 3) knowledge distillation to customize the TTS model on a high-quality target-speaker voice and improve the ASR model on multiple voices. We conduct experiments on an experimental language (English) and a truly low-resource language (Lithuanian) to verify the effectiveness of LRSpeech. Experimental results show that LRSpeech 1) achieves high quality for TTS in terms of both intelligibility (more than 98% intelligibility rate) and naturalness (above 3.5 mean opinion score (MOS)) of the synthesized speech, which satisfy the requirements for industrial deployment, 2) achieves promising recognition accuracy for ASR, and 3) last but not least, uses extremely low-resource training data. We also conduct comprehensive analyses on LRSpeech with different amounts of data resources, and provide valuable insights and guidances for industrial deployment. We are currently deploying LRSpeech into a commercialized cloud speech service to support TTS on more rare languages.
연구 동기 및 목표
- TTS 및 ASR 시스템에서 6,000개 이상의 저자원 및 희귀 언어에 대한 음성 훈련 데이터 부족 문제를 해결하기 위해.
- 극도로 자원이 부족한 언어를 위한 확장 가능하고 저비용의 솔루션을 개발하여 산업적 구현을 가능하게 하기 위해.
- 최소한의 쌍화된 데이터를 활용하고 쌍화되지 않은 음성 및 교차 작업 지식을 활용하여 TTS 및 ASR 성능을 향상시키기 위해.
- 희귀 언어를 위한 TTS 및 ASR 서비스를 상용 클라우드 플랫폼에 구현 가능하게 하기 위해.
제안 방법
- 풍부한 자원 언어에서의 사전 훈련 후 저자원 언어에서의 미세조정을 통해 언어적 및 음성 지식을 전이하기 위해.
- TTS와 ASR 간 상호 이중 변환으로, 각 모델이 가짜 쌍화된 데이터를 생성하여 상호 반복적으로 향상시키기 위해.
- TTS를 대상 화자 음성에 맞게 적응시키고, 다양한 화자에 대한 ASR의 강인성을 향상시키기 위해 지식 정복을 활용하기 위해.
- 보이는 및 보이지 않는 화자로부터의 쌍화되지 않은 음성 데이터를 활용하여 모델의 일반화 능력을 향상시키기 위해.
- 쌍화되지 않은 텍스트와 합성 음성 데이터를 활용하여 자기지도 학습을 통해 모델 성능을 추가로 향상시키기 위해.
- 다양한 화자로부터의 저품질 쌍화되지 않은 음성 데이터와 최소한의 쌍화된 데이터를 조합하여 데이터 효율성을 극대화하기 위해.
실험 결과
연구 질문
- RQ1저자원 환경에서 단지 몇 분의 쌍화된 데이터로 TTS 및 ASR 모델이 높은 성능을 달성할 수 있는가?
- RQ2최소한의 감독 하에 TTS와 ASR 간 이중 변환이 상호 성능 향상에 얼마나 효과적인가?
- RQ3합성 음성 데이터로부터의 지식 정복이 희귀 언어의 ASR 정확도 향상에 어느 정도 기여하는가?
- RQ4보이는 및 보이지 않는 화자로부터의 쌍화되지 않은 음성 데이터 포함 여부가 모델 일반화에 어떤 영향을 미치는가?
- RQ5제안된 프레임워크는 희귀 언어 지원을 위한 상용 클라우드 서비스에 구현 가능한가?
주요 결과
- LRSpeech는 리투아니아어에서 TTS 성능을 98.60%의 이해 가능성 비율과 3.65 평균 평가 점수(MOS)로 달성하여 산업적 구현 기준을 충족한다.
- ASR 모델은 단지 1.29시간의 쌍화된 훈련 데이터로 리투아니아어에서 17.04%의 단어 오류율(WER)과 10.30%의 문자 오류율(CER)을 기록한다.
- 저품질 쌍화된 데이터의 양을 늘일수록 TTS 성능이 향상되며, 데이터 양이 많을수록 정확도가 높아진다.
- 보이는 및 보이지 않는 화자로부터의 쌍화되지 않은 음성 데이터를 통합하면 TTS 및 ASR 정확도가 크게 향상된다.
- 합성 음성 데이터를 활용한 지식 정복은 ASR 성능 향상에 기여하며, 합성 데이터 비율이 높을수록 더 좋은 결과를 낳는다.
- 현재 시스템은 희귀 언어 지원을 위한 상용 클라우드 TTS 서비스에 도입 중이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.