Skip to main content
QUICK REVIEW

[논문 리뷰] Vakyansh: ASR Toolkit for Low Resource Indic languages

Harveen Singh Chadha, Anirudh Gupta|arXiv (Cornell University)|2022. 03. 30.
Speech Recognition and Synthesis인용 수 15
한 줄 요약

Vakyansh는 저자원 인도어 언어를 위한 오픈소스 엔드 투 엔드 ASR 툴킷으로, 23개 언어에 걸쳐 14,000시간의 레이블이 없는 음성 데이터와 10,000시간의 레이블이 있는 음성 데이터를 제공한다. wav2vec 2.0 기반 사전학습 및 미세조정을 통해 최신 기술 수준의 ASR 성능을 달성하며, 언어 모델을 통한 최대 20%의 WER 감소를 이끌어내고, 생산 환경에 적합한 추론를 위한 문장 부호 복원 및 역 텍스트 정규화를 지원한다.

ABSTRACT

We present Vakyansh, an end to end toolkit for Speech Recognition in Indic languages. India is home to almost 121 languages and around 125 crore speakers. Yet most of the languages are low resource in terms of data and pretrained models. Through Vakyansh, we introduce automatic data pipelines for data creation, model training, model evaluation and deployment. We create 14,000 hours of speech data in 23 Indic languages and train wav2vec 2.0 based pretrained models. These pretrained models are then finetuned to create state of the art speech recognition models for 18 Indic languages which are followed by language models and punctuation restoration models. We open source all these resources with a mission that this will inspire the speech community to develop speech first applications using our ASR models in Indic languages.

연구 동기 및 목표

  • 저자원 인도어 언어에 대해 데이터 및 사전학습 모델이 제한된 상태에서 오픈소스이자 엔드 투 엔드 ASR 툴킷이 부족한 문제를 해결하기 위해.
  • 23개 인도어 언어 전반에 걸쳐 데이터 수집, 정제, 주석 처리를 자동화하고 확장 가능한 파이프라인을 구축하기 위해.
  • wav2vec 2.0 및 전이 학습을 사용하여 18개 인도어 언어에 대해 최신 기술 수준의 ASR 모델을 훈련하고 공개하기 위해.
  • 생산 환경에 적합한 배포를 위해 언어 모델, 문장 부호 복원, 역 텍스트 정규화와 같은 후행 NLP 구성 요소를 통합하기 위해.
  • 오픈소스로 제공된 데이터, 모델, 도구를 통해 인도어 언어에서 음성 중심 애플리케이션의 보급을 촉진하기 위해.

제안 방법

  • 음성 활동 검출 및 음성 세그먼트 분할을 위해 WebRTC-VAD를 사용한 자동화된 오디오 처리 파이프라인을 구축하여 1~15초 간격의 세그먼트로 음성을 분할, 단어 경계 손상 방지.
  • WADA SNR를 적용하여 SNR < 20 또는 > 60인 저품질 오디오 세그먼트를 필터링하고, 초기 데이터의 35%를 노이즈로 간주하여 제거.
  • Resemblyzer 임베딩과 HDBSCAN 군집화를 활용해 각 화자 기여도를 90분 이내로 제한하여 과적합 방지.
  • 23개 인도어 언어에 걸쳐 14,000시간의 레이블이 없는 데이터로 다국어 wav2vec 2.0 모델을 사전학습하고, 18개 언어에 대해 10,000시간의 레이블이 있는 데이터로 미세조정.
  • 청결한 IndicCorp 데이터를 기반으로 5-gram KenLM 언어 모델을 훈련하고, LM 가중치 2와 단어 삽입 펜alty -1을 사용한 빔 서치를 통해 ASR 출력 향상.
  • 문장 부호 복원을 위한 다국어 IndicBERT 기반 토큰 분류 모델과 역 텍스트 정규화를 위한 룰 기반 WFST를 개발.

실험 결과

연구 질문

  • RQ1자동화되고 확장 가능한 파이프라인이 저자원 인도어 언어에 대해 고품질, 다양하고 균형 잡힌 음성 데이터를 생성할 수 있는가?
  • RQ2고자원 언어(예: 히нд어)에서의 다국어 사전학습이 저자원 인도어 언어의 ASR 성능을 얼마나 향상시킬 수 있는가?
  • RQ3언어 모델과 문장 부호 복원 기술이 WER 감소와 ASR 출력의 가독성 향상에 얼마나 효과적인가?
  • RQ4다국어 사전학습 모델(CLSRIL-23)에서의 전이 학습이 다양한 인도어 언어, 특히 저자원 언어에 대해 일반화 가능한가?
  • RQ5데이터 품질 지표(SNR, 화자 균형, 도메인 다양성)가 최종 ASR 모델 성능에 미치는 영향은 어떠한가?

주요 결과

  • 언어 모델을 사용한 Vakyansh 툴킷은 평균적으로 WER을 20% 감소시켰으며, 히нд어의 WER는 17.81에서 11.53으로 감소했다.
  • 다국어 CLSRIL-23 사전학습 모델은 목표 언어가 사전학습 데이터에 포함되지 않은 저자원 언어에 대해서도 효과적인 미세조정을 가능하게 했다.
  • IndicBERT 기반 문장 부호 복원으로 ASR 출력의 모호성이 감소하여 후속 NLP 작업에서 텍스트의 가독성이 향상되었다.
  • WFST 기반 역 텍스트 정규화는 말하는 숫자 형식(예: 'one thousand two hundred')을 표준 문장 형식으로 성공적으로 변환했다.
  • 파이프라인이 높은 데이터 품질을 확보하여 노이즈로 인한 초기 오디오 세그먼트의 35%를 거부했고, 성별 및 화자 분포의 균형을 확보했다.
  • 도그리(3.5시간), 마이티리(3시간), 아삼어(1.2시간)와 같은 저자원 언어 모델이 WER 35% 이하를 달성하여 자료 효율적 훈련의 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.