Skip to main content
QUICK REVIEW

[논문 리뷰] Model Adaptation for ASR in low-resource Indian Languages

Abhayjeet Singh, Arjun Mehta|arXiv (Cornell University)|2023. 07. 16.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 법인, 부자프리어 등 저자원 인도어를 위한 모델 적응 프레임워크인 MADASR를 제안한다. 이는 유사한 자원이 풍부한 언어에서의 자기지도 학습 및 교차 언어 전이를 활용하여 자동 음성 인식(ASR) 성능을 향상시키는 데 목적이 있다. 1,100시간의 내부 수집 Bhojpuri 및 방언 특화 법인어 음성 데이터를 사용하여, 공통된 언어적 구조를 활용함으로써 제한된 텍스트 및 음성 데이터로 사전 훈련된 음성 모델을 미세조정할 경우, 저자원 환경에서 ASR 성능이 크게 향상됨을 보여준다.

ABSTRACT

Automatic speech recognition (ASR) performance has improved drastically in recent years, mainly enabled by self-supervised learning (SSL) based acoustic models such as wav2vec2 and large-scale multi-lingual training like Whisper. A huge challenge still exists for low-resource languages where the availability of both audio and text is limited. This is further complicated by the presence of multiple dialects like in Indian languages. However, many Indian languages can be grouped into the same families and share the same script and grammatical structure. This is where a lot of adaptation and fine-tuning techniques can be applied to overcome the low-resource nature of the data by utilising well-resourced similar languages. In such scenarios, it is important to understand the extent to which each modality, like acoustics and text, is important in building a reliable ASR. It could be the case that an abundance of acoustic data in a language reduces the need for large text-only corpora. Or, due to the availability of various pretrained acoustic models, the vice-versa could also be true. In this proposed special session, we encourage the community to explore these ideas with the data in two low-resource Indian languages of Bengali and Bhojpuri. These approaches are not limited to Indian languages, the solutions are potentially applicable to various languages spoken around the world.

연구 동기 및 목표

  • 자원이 부족한 인도어, 특히 음성 및 텍스트 데이터가 제한된 방언인 법인어와 부자프리어에 대한 저자원 자동 음성 인식(ASR) 문제를 해결한다.
  • 공통된 문법적 특성(글자, 문법)과 사전 훈련된 모델을 활용하여 방언 형태의 자원 부족 문제를 해결한다.
  • 자원이 제한된 환경에서 음성 데이터와 텍스트 데이터의 상대적 중요성을 평가한다.
  • 향후 저자원 ASR 연구를 지원하기 위해 부자프리어 및 5개의 법인어 방언에 대한 다이얼ект 풍부한 내부 음성 코퍼스를 개발하고 공개한다.
  • 이론적 불능자들을 위한 음성 기반 디지털 접근성을 높이기 위해 전이 학습 및 자료 효율적인 적응 전략을 활용한 견고하고 방언 인식 능력을 갖춘 ASR 시스템을 구축한다.

제안 방법

  • 저자원 ASR를 위한 기본 음성 인코더로 wav2vec2와 같은 자기지도 학습(SSL) 모델을 사용한다.
  • Bhojpuri(1,100시간) 및 5개의 법인어 방언에서 내부적으로 수집한 제한된 음성 데이터를 기반으로 사전 훈련된 SSL 모델을 미세조정한다.
  • 공통된 문자 및 문법적 구조를 가진 유사 언어에서의 지식 전이를 통해 잘 자원된 언어에서 저자원 방언으로 지식을 전이함으로써 교차 언어 적응을 수행한다.
  • 가용한 텍스트 데이터를 활용해 n-gram 언어 모델을 구축하여 저자원 환경에서의 언어 모델링 성능을 향상시킨다.
  • 우타르 프라데시, 비하르, 웨스트 벵골 및 인근 주에서의 지역적 변형(발음, 어휘, 음소학적 특성)을 고려한 다이얼렉트 특화 데이터 수집 전략을 구현한다.
  • 베이징 방언 및 부자프리어의 지역적 변형 간 일반화 능력과 성능 평가를 위해 다이얼렉트 기반 평가 설정을 도입한다.

실험 결과

연구 질문

  • RQ1자기지도 학습 모델이 제한된 음성 데이터에 대해 효과적으로 미세조정될 수 있는 정도는 어느 정도이며, 저자원 인도어에서 견고한 ASR 성능을 달성할 수 있는가?
  • RQ2저자원 ASR에서 대규모 태깅 코퍼스가 필요로 하는 정도를 줄이기 위해 음성 데이터와 텍스트 데이터의 가용성은 어떻게 비교되는가?
  • RQ3유사한 자원이 풍부한 언어에서의 교차 언어 전이가 공통된 문자 및 문법을 공유하는 저자원 방언의 ASR 성능을 크게 향상시킬 수 있는가?
  • RQ4다이얼렉트 특화 데이터 수집 전략이 법인어 및 부자프리어의 지역적 변형 간 ASR 모델의 성능과 일반화 능력에 미치는 영향은 어떠한가?
  • RQ5내부 음성 코퍼스와 n-gram 언어 모델의 조합이 사전 훈련된 음성 모델을 미세조정할 때 ASR 정확도 향상에 얼마나 효과적인가?

주요 결과

  • 제안된 MADASR 프레임워크는 제한된 방언 특화 음성 데이터에 대해 자기지도 학습 모델을 타겟팅하여 미세조정함으로써, 저자원 인도어인 법인어 및 부자프리어의 ASR 성능을 크게 향상시킨다.
  • 1,100시간의 내부 수집 부자프리어 음성 데이터를 활용함으로써, 언어의 저자원 성격에도 불구하고 의미 있는 모델 적응이 가능함을 입증한다.
  • 유사 언어 간 공통된 언어적 특성(예: 데바나가리 문자, 문법적 구조)을 활용한 교차 언어 전이가 효과적인 ASR 훈련을 위한 데이터 의존도를 감소시킨다.
  • 연구 결과는 방언 인식 데이터 수집 및 모델 미세조정 전략이 지역적 변형을 가진 법인어 및 부자프리어의 ASR 정확도 향상에 측정 가능한 기여를 한다고 보여준다.
  • 미세조정된 SSL 음성 모델과 n-gram 언어 모델의 통합이 특히 저자원 환경에서 인식 성능 향상에 기여한다.
  • 결과적으로, 모델 아키텍처와 적응 전략에 따라 음성 데이터의 다수는 제한된 텍스트 데이터를 상쇄할 수 있으며, 반대로 텍스트 데이터의 다수는 제한된 음성 데이터를 상쇄할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.