Skip to main content
QUICK REVIEW

[논문 리뷰] Effectiveness of Mining Audio and Text Pairs from Public Data for Improving ASR Systems for Low-Resource Languages

Kaushal Santosh Bhogale, Abhigyan Raman|arXiv (Cornell University)|2022. 08. 26.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 All India Radio의 공공 아카이브에서 고품질의 음성-텍스트 쌍을 추출하여 12개 인도어를 위한 6,457시간 분량의 다국어 음성 인식(ASR) 데이터셋인 Shrutilipi를 구축한다. OCR로 변환된 텍스트와 CTC로 정렬된 ASR 출력 간의 정렬에 Needleman-Wunsch 알고리즘을 변형 적용함으로써, OCR 오류와 비음성화된 음성 영역가 존재하더라도 견고한 정렬을 달성하였으며, 이로 인해 Wav2Vec 모델을 미세조정했을 때 IndicSUPERB 벤치마크에서 평균 5.8%의 WER 감소를 이룬다.

ABSTRACT

End-to-end (E2E) models have become the default choice for state-of-the-art speech recognition systems. Such models are trained on large amounts of labelled data, which are often not available for low-resource languages. Techniques such as self-supervised learning and transfer learning hold promise, but have not yet been effective in training accurate models. On the other hand, collecting labelled datasets on a diverse set of domains and speakers is very expensive. In this work, we demonstrate an inexpensive and effective alternative to these approaches by ``mining'' text and audio pairs for Indian languages from public sources, specifically from the public archives of All India Radio. As a key component, we adapt the Needleman-Wunsch algorithm to align sentences with corresponding audio segments given a long audio and a PDF of its transcript, while being robust to errors due to OCR, extraneous text, and non-transcribed speech. We thus create Shrutilipi, a dataset which contains over 6,400 hours of labelled audio across 12 Indian languages totalling to 4.95M sentences. On average, Shrutilipi results in a 2.3x increase over publicly available labelled data. We establish the quality of Shrutilipi with 21 human evaluators across the 12 languages. We also establish the diversity of Shrutilipi in terms of represented regions, speakers, and mentioned named entities. Significantly, we show that adding Shrutilipi to the training set of Wav2Vec models leads to an average decrease in WER of 5.8\% for 7 languages on the IndicSUPERB benchmark. For Hindi, which has the most benchmarks (7), the average WER falls from 18.8% to 13.5%. This improvement extends to efficient models: We show a 2.3% drop in WER for a Conformer model (10x smaller than Wav2Vec). Finally, we demonstrate the diversity of Shrutilipi by showing that the model trained with it is more robust to noisy input.

연구 동기 및 목표

  • 저자원 인도어를 위한 대규모, 다양한 종류의 고품질 레이블이 부여된 음성 데이터의 부족 문제를 해결하기 위해.
  • All India Radio 뉴스 브리핑과 같은 공개적이고 비정형 아카이브에서 음성과 텍스트 쌍을 효과적으로 추출할 수 있는 확장성 있고 견고한 방법을 개발하기 위해.
  • 추출된 데이터셋의 효과성을 다양한 벤치마크, 특히 소음 환경과 효율적인 모델 아키텍처에서의 ASR 성능 향상에 대해 평가하기 위해.
  • 공개 데이터를 채굴하는 것이 엔드 투 엔드 ASR 시스템에서 고자원 언어와 저자원 언어 간의 성능 격차를 크게 줄일 수 있음을 입증하기 위해.

제안 방법

  • 장기적인 음성 뉴스 브리핑을 All India Radio에서 확보하여, ASR 시스템(IndicWav2Vec)을 사용해 음성 세그먼트의 CTC 정렬 문자 시퀀스를 생성한다.
  • OCR를 통해 PDF 전사본에서 텍스트를 추출한 후, 형식, 메타데이터, 비음성화된 콘텐츠를 처리하기 위해 텍스트 정제를 수행한다.
  • OCR 오류와 음성의 이질성에 대응하기 위해 삽입, 삭제, 불일치에 대한 보상을 적용한 수정된 Needleman-Wunsch 알고리즘을 사용해 전사 텍스트 세그먼트와 해당 음성 세그먼트를 정렬한다.
  • 비음성화된 음성, 배경 음악, 코드 믹싱 등에 대해 유사도가 높은 문장 쌍에 집중함으로써, 정렬 과정이 이러한 요소를 견딜 수 있도록 최적화한다.
  • 최종적으로 생성된 데이터셋인 Shrutilipi는 12개 인도어에서 6,400시간 이상의 음성과 495만 개의 문장이 포함되어 있으며, 21명의 인간 평가자들이 엄격한 품질 평가를 수행하였다.
  • Shrutilipi의 효과성은 Wav2Vec 및 Conformer 모델을 다양한 벤치마크에서 미세조정하여 평가하였으며, 청소된 환경과 소음 환경 모두를 포함한다.

실험 결과

연구 질문

  • RQ1공개적이고 비정형적인 음성 및 텍스트 아카이브에서 효과적으로 고품질의 대규모 학습 데이터를 추출할 수 있는가?
  • RQ2OCR 오류, 비음성화된 음성, 형식 불일치 상황에서 수정된 Needleman-Wunsch 알고리즘이 음성과 텍스트 세그먼트를 얼마나 효과적으로 정렬하는가?
  • RQ3Shrutilipi에서 추출한 데이터를 추가로 활용할 경우, 이전에 존재하던 공개 데이터셋에 비해 저자원 인도어 ASR 성능에 얼마나 기여하는가?
  • RQ4Shrutilipi로 학습한 모델은 특히 실세계 구현 환경에서 소음이 있는 입력에 대해 얼마나 더 견고한가?

주요 결과

  • Shrutilipi는 12개 인도어에서 총 6,457시간의 레이블이 부여된 음성을 포함하며, 기존 공개 데이터셋 대비 평균 2.3배의 학습 데이터 증가를 기록한다.
  • 인간 평가를 통해 데이터셋의 고품질을 확인하였으며, 12개 언어에서 21명의 평가자가 데이터가 신뢰할 수 있고 다양한 지역 및 언어적 다양성을 잘 반영하고 있다고 평가했다.
  • Shrutilipi에서 Wav2Vec 모델을 미세조정하면 IndicSUPERB 벤치마크에서 7개 인도어에 대해 평균 5.8%의 상대적 WER 감소를 이룩하였으며, 힌두어의 경우 WER가 18.8%에서 13.5%로 감소하였다.
  • Wav2Vec보다 10배 작아진 Conformer 모델도 Shrutilipi에서 학습함으로써 2.3%의 절대적 WER 감소를 달성하였으며, 이는 효율적인 아키텍처에서도 효과가 있음을 보여준다.
  • ESC 데이터셋에서 추가된 배경 소음이 있는 디지털 벤치마크에서 Shrutilipi로 학습한 모델은 평균 5.9%의 WER 감소를 기록하여, 소음에 대한 저항력 향상이 확인되었다.
  • 화자, 지역, 고유명사의 다양성이 검증되었으며, 더 작은, 다각도가 부족한 데이터로 학습한 모델에 비해, 도메인 외부 및 소음이 있는 테스트 세트에서 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.