Skip to main content
QUICK REVIEW

[논문 리뷰] Bengali Common Voice Speech Dataset for Automatic Speech Recognition

Samiul Alam, Asif Shahriyar Sushmit|arXiv (Cornell University)|2022. 06. 28.
Speech Recognition and Synthesis인용 수 10
한 줄 요약

이 논문은 모질라 커먼 바이스 플랫폼을 통해 수집된 커뮤니티 기반의 오픈소스 자동 음성 인식(ASR) 코퍼스인 벵골 공통 음성 음성 데이터셋을 소개한다. 단 두 달 만에 400시간이 넘는 다양한 문장 수준의 음성 데이터를 확보하여, 화자, 자음음소, 환경적 요건에서의 다양성이 뛰어나, 향후 벵골어 ASR 연구를 위한 기준을 설정하며, 보고된 모델 성능 지표를 제공한다.

ABSTRACT

Bengali is one of the most spoken languages in the world with over 300 million speakers globally. Despite its popularity, research into the development of Bengali speech recognition systems is hindered due to the lack of diverse open-source datasets. As a way forward, we have crowdsourced the Bengali Common Voice Speech Dataset, which is a sentence-level automatic speech recognition corpus. Collected on the Mozilla Common Voice platform, the dataset is part of an ongoing campaign that has led to the collection of over 400 hours of data in 2 months and is growing rapidly. Our analysis shows that this dataset has more speaker, phoneme, and environmental diversity compared to the OpenSLR Bengali ASR dataset, the largest existing open-source Bengali speech dataset. We present insights obtained from the dataset and discuss key linguistic challenges that need to be addressed in future versions. Additionally, we report the current performance of a few Automatic Speech Recognition (ASR) algorithms and set a benchmark for future research.

연구 동기 및 목표

  • 벵골어는 영향력은 크지만 자원이 부족한 언어이므로, 오픈소스이자 다양한 음성 데이터셋의 부족 문제를 해결하기 위해.
  • 모질라 커먼 바이스 플랫폼을 활용한 캠페인을 통해 대규모의 문장 수준 ASR 코퍼스를 수집하기 위해.
  • 실생활에서 다양하게 활용되는 음성 데이터를 사용하여, 벵골어 ASR 시스템의 훈련 및 평가 기준을 제공하기 위해.
  • 저자원 기반 음성 인식에서의 언어학적 및 데이터 다양성 문제를 규명하기 위해.

제안 방법

  • 모질라 커먼 바이스 플랫폼을 통한 커뮤니티 기반 음성 수집을 통해 일반 대중이 벵골어 문장을 녹음하는 데 참여할 수 있도록 하였다.
  • 엔드 투 엔드 자동 음성 인식을 지원하기 위해 문장 수준의 번역을 중심으로 데이터 수집을 수행하였다.
  • 다양한 화자, 지역 방언, 다양한 배경 소음 조건을 포함시켜 데이터의 강건성을 향상시켰다.
  • 자동 및 수동 점검을 통한 데이터셋 정제 및 검증을 통해 번역 정확도와 음성 품질을 확보하였다.
  • 표준 자동 음성 인식 아키텍처와 훈련 프로토콜을 사용하여 데이터셋에서 ASR 모델을 평가하였다.
  • 화자, 자음음소, 환경적 다양성 측면에서 기존의 오픈슬러 벵골어 ASR 데이터셋과의 비교 분석을 수행하였다.

실험 결과

연구 질문

  • RQ1벵골 공통 음성 데이터셋의 화자 인구통계학적 특성, 자음음소, 환경 조건의 다양성은 기존 오픈소스 벵골어 ASR 데이터셋과 비교해 어떻게 다른가?
  • RQ2최신 기술의 ASR 모델이 이 새로운 데이터셋에서 훈련을 거치면 어떤 성능을 달성할 수 있는가?
  • RQ3데이터셋 내에서 지속적으로 존재하는 언어학적 및 데이터 품질 문제들은 향후 ASR 모델 성능에 어떤 영향을 미칠 수 있는가?
  • RQ4데이터셋의 확장성과 지속적인 성장은 장기적인 연구에 있어 어떤 영향을 미치는가?
  • RQ5데이터셋은 배경 소음에 대한 저항성과 벵골어 발음의 지역적 다양성에 대해 얼마나 잘 대응할 수 있는가?

주요 결과

  • 벵골 공통 음성 데이터셋은 단 두 달 만에 400시간 이상의 음성 데이터를 확보하여, 벵골어 ASR를 위한 훈련 데이터 확보에 크게 기여하였다.
  • 오픈슬러 벵골어 ASR 데이터셋과 비교해 화자, 자음음소, 환경 조건에서 더 높은 다양성을 보였다.
  • 초기 ASR 모델 평가 결과, 새로운 데이터셋에서 훈련한 모델이 측정 가능한 성능 향상을 보이며 새로운 기준을 설정하였다.
  • 지속적인 성장과 오픈 액세스 성격 덕분에, 저자원 기반 음성 인식 분야의 향후 연구를 위한 지속 가능한 자원이 되었다.
  • 지역적 발음의 다양성과 배경 소음 등 언어학적 문제들은 여전히 존재하며, 향후 연구에서는 이러한 문제에 대응하는 특화된 모델링 접근이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.