[논문 리뷰] Text-To-Speech Data Augmentation for Low Resource Speech Recognition
이 논문은 퀘치와 같은 저자원, 복합어형 언어에 대해 텍스트-to-음성(TTS) 기반의 데이터 증강 방법을 제안한다. 이 방법은 순서-순서(sequence-to-sequence, seq2seq) 텍스트 생성과 TTS를 조합하여 합성 텍스트와 음성을 동시에 생성한다. 이 접근법은 퀘치 음성 인식(ASR) 모델에서 단어 오류율(WER)을 상대적으로 8.73% 향상시켜 저자원 음성 인식 성능 향상에 있어 뚜렷한 개선 효과를 보였다.
Nowadays, the main problem of deep learning techniques used in the development of automatic speech recognition (ASR) models is the lack of transcribed data. The goal of this research is to propose a new data augmentation method to improve ASR models for agglutinative and low-resource languages. This novel data augmentation method generates both synthetic text and synthetic audio. Some experiments were conducted using the corpus of the Quechua language, which is an agglutinative and low-resource language. In this study, a sequence-to-sequence (seq2seq) model was applied to generate synthetic text, in addition to generating synthetic speech using a text-to-speech (TTS) model for Quechua. The results show that the new data augmentation method works well to improve the ASR model for Quechua. In this research, an 8.73% improvement in the word-error-rate (WER) of the ASR model is obtained using a combination of synthetic text and synthetic speech.
연구 동기 및 목표
- 저자원 언어의 경우 훈련을 위한 전사된 음성 데이터가 부족한 문제를 해결하기 위해.
- 특히 퀘치와 같은 복합어형 언어의 음성 인식(ASR) 성능을 향상시키기 위해 합성 훈련 데이터를 생성함으로써.
- 순서-순서(seq2seq) 텍스트 생성과 텍스트-to-음성(TTS) 합성의 조합을 통한 하이브리드 데이터 증강 프레임워크를 개발하고 평가하기 위해.
- 합성 데이터의 효과성을 입증하여 저자원 ASR 환경에서 단어 오류율(WER) 감소에 기여하기 위해.
제안 방법
- 기존의 전사된 음성 데이터를 기반으로 퀘치어에서 합성 텍스트를 생성하기 위해 순서-순서(seq2seq) 모델을 훈련한다.
- 생성된 합성 텍스트를 음성으로 변환하기 위해 별도의 텍스트-to-음성(TTS) 모델을 훈련한다.
- 합성 텍스트와 음성 쌍을 실제 훈련 데이터와 결합하여 ASR 훈련 세트를 증강한다.
- 증강된 데이터셋을 사용해 사전 훈련된 ASR 모델을 미세조정함으로써 모델의 강인성과 일반화 능력을 향상시킨다.
- 퀘치어 언어 코퍼스를 사용하여 평가하며, 이는 저자원, 복합어형 언어로 전사된 데이터가 제한되어 있다.
- 의미적으로 타당하고 청각적으로 타당한 발화를 생성함으로써 언어학적 및 음향적 데이터 증강을 동시에 구현한다.
실험 결과
연구 질문
- RQ1퀘치와 같은 저자원, 복합어형 언어에서 합성 텍스트와 음성 생성이 음성 인식(ASR) 성능 향상에 기여할 수 있는가?
- RQ2seq2seq + TTS를 조합한 데이터 증강 파이프라인은 ASR 모델의 단어 오류율(WER) 감소에 얼마나 효과적인가?
- RQ3합성 데이터의 품질이 저자원 환경에서 ASR 모델의 일반화 능력에 영향을 미치는가?
- RQ4합성 텍스트와 합성 음성 중 어느 것이 ASR 성능 향상에 더 큰 기여를 하는가?
주요 결과
- 제안된 데이터 증강 방법은 퀘치 ASR 모델에서 단어 오류율(WER)에 대해 상대적으로 8.73% 향상된 성과를 달성했다.
- 합성 텍스트와 합성 음성을 함께 사용할 경우, 각각의 모odalities를 별도로 사용하는 것보다 더 높은 성능 향상을 보였다.
- seq2seq 모델은 복합어형 언어 특유의 형태소 복잡성을 유지하면서 언어학적으로 타당한 퀘치어 텍스트를 성공적으로 생성했다.
- TTS 모델은 ASR 미세조정에 효과적인 자연스러운 합성 음성을 생성했다.
- 실제 전사된 데이터가 부족한 저자원 환경에서도 이 방법이 강인함을 입증했다.
- TTS와 seq2seq를 통한 합성 데이터 생성이 훈련 데이터를 효과적으로 확장하고 ASR 일반화 능력을 향상시킬 수 있음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.