Skip to main content
QUICK REVIEW

[논문 리뷰] Applying wav2vec2 for Speech Recognition on Bengali Common Voices Dataset

H. A. Z. Sameen Shahgir, Khondker Salman Sayeed|arXiv (Cornell University)|2022. 09. 11.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 저자원 벤골어를 위한 음성 인식 성능을 향상시키기 위해 벤골 공용 음성 데이터셋의 정제된 서브셋에 대해 Facebook의 wav2vec2.0-large-xlsr-53을 미세조정하는 방법을 제안한다. 37,500개의 고품질, 업본 음성 샘플을 사용해 훈련한 후 검증 데이터와 결합한 결과, 테스트 데이터에서 단어 오류율(WER)이 0.2524이고 레벤슈타인 거리가 2.6075로 나타나, 은닉 테스트 세트에서 다른 제출물들보다 뛰어난 성능을 보였다.

ABSTRACT

Speech is inherently continuous, where discrete words, phonemes and other units are not clearly segmented, and so speech recognition has been an active research problem for decades. In this work we have fine-tuned wav2vec 2.0 to recognize and transcribe Bengali speech -- training it on the Bengali Common Voice Speech Dataset. After training for 71 epochs, on a training set consisting of 36919 mp3 files, we achieved a training loss of 0.3172 and WER of 0.2524 on a validation set of size 7,747. Using a 5-gram language model, the Levenshtein Distance was 2.6446 on a test set of size 7,747. Then the training set and validation set were combined, shuffled and split into 85-15 ratio. Training for 7 more epochs on this combined dataset yielded an improved Levenshtein Distance of 2.60753 on the test set. Our model was the best performing one, achieving a Levenshtein Distance of 6.234 on a hidden dataset, which was 1.1049 units lower than other competing submissions.

연구 동기 및 목표

  • 저자원 언어인 벤골어에 대해 음성 인식 성능을 향상시키기 위해.
  • 다국어 wav2vec2.0을 사용한 자기지도 학습 미리 훈련이 저자원 언어인 벤골어에 대해 얼마나 효과적인지 조사하기 위해.
  • 업본/다운본 메트릭을 활용한 데이터 품질 필터링이 모델 성능에 미치는 영향을 평가하기 위해.
  • 증분적인 데이터 노출 방식인 단계별 훈련(증가하는 데이터셋 크기)이 미리보기 불가능한 테스트 데이터에 대한 일반화 능력에 어떤 영향을 미치는지 탐색하기 위해.
  • 최소한의 레이블된 데이터로도 다국어 미리 훈련된 모델을 미세조정함으로써, 벤골어 음성 인식에서 최신 기술 수준의 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 업본 수치가 다운본 수치를 초월하는 샘플들만 선택하여, 정제된 벤골 공용 음성 데이터셋의 서브셋에 대해 자기지도 학습된 wav2vec2.0-large-xlsr-53 모델을 미세조정하였다.
  • 오디오 파일을 16kHz로 리샘플링하고, 번역문을 문자 단위로 토크나이징하여 모델 입력으로 사용하였다.
  • 두 단계로 훈련: 첫 번째 단계에서는 37,500개의 훈련 샘플에서 훈련하고, 두 번째 단계에서는 재셔플링한 후 훈련 및 검증 데이터를 합쳐 45,000개 샘플의 데이터셋에서 재훈련하였다.
  • 추론 단계에서 5-그램 언어 모델을 적용하여 테스트 세트에서 레벤슈타인 거리 향상을 도모하였다.
  • 미세조정 중에 예측 번역문과 진짜 번역문을 정렬하기 위해 연결주의 시간 분류(CTC) 손실를 사용하였다.
  • 별도의 테스트 세트에서 단어 오류율(WER)과 레벤슈타인 거리로 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1저자원 언어인 벤골어 음성 인식에서 다국어 자기지도 학습된 wav2vec2.0 모델이 제한된 레이블된 데이터로도 강력한 성능을 낼 수 있는가?
  • RQ2업본/다운본 메트릭을 활용한 훈련 데이터 필터링이 저자원 음성 인식 작업의 성능 향상에 기여하는가?
  • RQ3훈련 중에 점진적으로 더 큰, 결합된 데이터셋에 노출되는 것이 미리보기 불가능한 테스트 데이터에 대한 일반화 능력 향상에 기여하는가?
  • RQ4공용 음성 데이터셋의 정제된 서브셋에 대해 미세조정된 wav2vec2.0의 성능이 다른 모델들보다 어떻게 비교되는가?
  • RQ5유럽어를 기반으로 한 미리 훈련이 벤골어와 같이 비유럽어 저자원 언어의 성능에 어떤 영향을 미치는가?

주요 결과

  • 검증 세트(7,747개 샘플)에서 71 에포크 후 모델은 훈련 손실 0.3172와 단어 오류율(WER) 0.2524를 기록하였다.
  • 더 큰 45,000개 샘플 데이터셋으로 결합하고 재훈련한 후, 테스트 세트에서 레벤슈타인 거리가 2.6446에서 2.60753으로 향상되었다.
  • 은닉 테스트 세트에서 레벤슈타인 거리는 6.234로 나타나, 경쟁 제출물보다 1.1049 단위 낮은 성능을 보였다.
  • 과적합 현상이 뚜렷하지 않게 안정적인 성능을 보였으며, 손실와 WER가 정체된 이후에도 평가 지표가 약간 향상되는 경향을 보였다.
  • 추론 단계에서 5-그램 언어 모델을 사용함으로써 테스트 세트에서 레벤슈타인 거리가 감소하여, 번역 오류에 대한 회복력 향상이 확인되었다.
  • 결과적으로, 벤골어와 유사한 언어에서 미리 훈련된 모델을 사용할 경우 더 높은 성능을 기대할 수 있으며, 현재 모델는 기존 최고 기술 수준에 비해 근소한 향상만을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.