Skip to main content
QUICK REVIEW

[논문 리뷰] BembaSpeech: A Speech Recognition Corpus for the Bemba Language

Claytone Sikasote, Antonios Anastasopoulos|arXiv (Cornell University)|2021. 02. 09.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 짐바브웨 인구의 30퍼센트 이상이 사용하는 저자원 루간다어인 범바어를 위한 24시간 독서 음성 코퍼스인 BembaSpeech를 소개한다. 이 코퍼스를 바탕으로 사전 학습된 영어 DeepSpeech 모델을 미세조정함으로써 저자원 루간다어를 위한 엔드 투 엔드 음성 인식 시스템의 구현 가능성을 입증하며, 단어 오류율(WER) 54.78%를 달성하였다.

ABSTRACT

We present a preprocessed, ready-to-use automatic speech recognition corpus, BembaSpeech, consisting over 24 hours of read speech in the Bemba language, a written but low-resourced language spoken by over 30% of the population in Zambia. To assess its usefulness for training and testing ASR systems for Bemba, we train an end-to-end Bemba ASR system by fine-tuning a pre-trained DeepSpeech English model on the training portion of the BembaSpeech corpus. Our best model achieves a word error rate (WER) of 54.78%. The results show that the corpus can be used for building ASR systems for Bemba. The corpus and models are publicly released at https://github.com/csikasote/BembaSpeech.

연구 동기 및 목표

  • 잠비아어 및 아프리카어에서 음성 인식(ASR)을 위한 언어 자원의 부족 문제를 해결하기 위해.
  • 잠비아 인구의 30퍼센트 이상이 사용하는 Bemba어를 위한 공개 가능하고 사전 처리된 음성 코퍼스를 구축하기 위해.
  • 사전 학습된 영어 모델에서 전이 학습을 통해 Bemba어를 위한 엔드 투 엔드 ASR 시스템을 학습하는 것이 가능한지를 입증하기 위해.
  • Bantu어 및 아프리카어의 저자원 음성 인식 분야 향후 연구를 위한 기준을 마련하기 위해.

제안 방법

  • BembaSpeech 코퍼스는 짐바브웨 전역의 100명의 모국어 사용자로부터 수집되었으며, 통제된 환경에서 독서 음성 기록을 포함한다.
  • 이 데이터셋은 총 24시간의 음성으로 구성되어 있으며, 훈련(17.5시간), 검증(3.5시간), 테스트(3시간) 세트로 나뉘어져 있다.
  • 초기 학습률을 0.00005로 설정하여, 원래 영어 음성 데이터로 사전 학습된 DeepSpeech 모델을 BembaSpeech 훈련 세트에서 미세조정하였다.
  • KenLM를 사용하여 음성 전사본과 JW300 데이터셋에서 확보한 추가 Bemba 텍스트를 기반으로 언어 모델을 학습시켜 ASR 성능을 향상시켰다.
  • 최종 모델은 훈련 및 검증 전사본에서만 생성된 5-그램 언어 모델과 미세조정된 음성 모델을 조합하였다.
  • 모델 평가에는 표준 지표인 단어 오류율(WER)과 문자 오류율(CER)을 사용하였으며, 훈련 중에는 조기 정지와 드롭아웃 정규화를 적용하였다.

실험 결과

연구 질문

  • RQ1사전 학습된 영어 ASR 모델이 저자원 Bemba 음성 코퍼스에서 효과적으로 성능을 내기 위해 미세조정될 수 있는가?
  • RQ2언어 모델을 통합할 경우 Bemba ASR 시스템의 성능에 어떤 영향을 미치는가?
  • RQ3JW300 데이터셋과 같은 외부 소스에서 확보한 추가 Bemba 텍스트를 포함시키면 ASR 성능이 향상되는가?
  • RQ4전이 학습을 통해 학습된 Bemba ASR 모델의 성능은 초기 상태에서 학습을 시작한 경우와 비교해 어떻게 되는가?
  • RQ5WER 향상 최적화를 위해 언어 모델의 n-그램 크기와 데이터 소스의 조합은 어떤 것이 가장 적합한가?

주요 결과

  • 사전 학습된 DeepSpeech 모델을 미세조정하고, 전사본에서 학습된 5-그램 언어 모델과 조합한 최고의 성능 모델이 단어 오류율(WER) 54.78%를 달성하였다.
  • 언어 모델을 통합함으로써 WER는 미세조정된 모델만 사용했을 때의 71.21%에서 54.78%로 감소하여 뚜렷한 성능 향상을 입증하였다.
  • JW300 데이터셋에서 확보한 외부 Bemba 텍스트를 추가로 포함시켰을 경우, WER는 3-그램 언어 모델을 사용했을 때 55.65%로 약간 증가하여 이 데이터 소스가 이 설정에서는 유의미한 이득을 주지 않았음을 나타냈다.
  • 초기 상태에서 학습한 모델(기준 모델)은 WER 85.67%를 기록하여, 저자원 환경에서 전이 학습의 우수성을 입증하였다.
  • 학습률 0.00005로 미세조정하고 드롭아웃 비율을 0.4로 설정한 조합이 가장 우수한 결과를 냈으며, 과적합 방지를 위해 조기 정지를 적용하였다.
  • 코퍼스와 훈련된 모델은 GitHub에 공개되어 향후 연구와 재현 가능성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.