Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Speech Recognition for Speech Assessment of Persian Preschool Children

Amirhossein Abaskohi, Fatemeh Mortazavi|arXiv (Cornell University)|2022. 03. 24.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 페르시아어 유아의 말소리 인식에 어려움이 있는 스펙트럼 및 시간적 변동성 문제를 해결하기 위해 Wav2Vec 2.0 모델의 새로운 사전 훈련 목표인 Random Frequency Pitch(RFP)를 제안한다. RFP는 자율 음성 인식(ASR) 성능을 향상시키며, 의미 없는 단어 및 빠른 자동 이름 지정 테스트에서 각각 1.35의 단어 오류률(WER)을 기록하여 표준 마스킹보다 뛰어난 성능을 보였다. 이는 제로-샷 및 피처-샷 설정에서도 뛰어난 성능을 발휘한다.

ABSTRACT

Preschool evaluation is crucial because it gives teachers and parents influential knowledge about children's growth and development. The COVID-19 pandemic has highlighted the necessity of online assessment for preschool children. One of the areas that should be tested is their ability to speak. Employing an Automatic Speech Recognition (ASR) system would not help since they are pre-trained on voices that differ from children's in terms of frequency and amplitude. Because most of these are pre-trained with data in a specific range of amplitude, their objectives do not make them ready for voices in different amplitudes. To overcome this issue, we added a new objective to the masking objective of the Wav2Vec 2.0 model called Random Frequency Pitch (RFP). In addition, we used our newly introduced dataset to fine-tune our model for Meaningless Words (MW) and Rapid Automatic Naming (RAN) tests. Using masking in concatenation with RFP outperforms the masking objective of Wav2Vec 2.0 by reaching a Word Error Rate (WER) of 1.35. Our new approach reaches a WER of 6.45 on the Persian section of the CommonVoice dataset. Furthermore, our novel methodology produces positive outcomes in zero- and few-shot scenarios.

연구 동기 및 목표

  • 성인 말소리와의 음향적 차이로 인해 페르시아어 유아 말소리의 ASR 정확도가 낮은 문제를 해결한다.
  • 유아의 음성 특성(예: 높은 형주파수, 넓은 주파수 대역)을 고려하지 않는 표준 Wav2Vec 2.0 사전 훈련 목표의 한계를 극복한다.
  • 특히 빠른 자동 이름 지정(RAN) 및 의미 없는 단어(MW) 테스트를 위한, 인지 평가에 특화된 도메인 적응형 ASR 시스템을 개발한다.
  • 페르시아어 저자원 유아 말소리 인식에서 제로-샷 및 피처-샷 일반화 성능을 향상시킨다.
  • 개발 평가 맥락에서 ASR 모델의 미세조정 및 평가를 위해 새로운 페르시아어 유아 말소리 데이터셋을 구축하고 공개한다.

제안 방법

  • 자기지도 학습 사전 훈련 중에 마스킹된 오디오 패치에 무작위 주파수 피치를 적용하는 새로운 사전 훈련 목표인 Random Frequency Pitch(RFP)를 제안하여 주파수 도메인 전반에서의 강인성을 향상시킨다.
  • RAN 및 MW 과제를 위한 페르시아어 말소리 데이터에서 CommonVoice 데이터셋과 새로 수집한 유아 말소리 데이터셋을 사용해 RFP가 강화된 Wav2Vec 2.0 모델을 미세조정한다.
  • 12개의 Transformer 블록, d_model = 768, d_ff = 3072, 8개의 어텐션 헤드를 가진 수정된 Wav2Vec 2.0 아키텍처를 사용하며, 표준 텍스트 없이 960시간의 LibriSpeech-960 영어 데이터로 훈련한다.
  • 사전 훈련 중에 온도 τ를 2에서 0.5로 점진적으로 낮춘 Gumbel-Softmax와 온도 κ = 0.1을 사용한 대비 손실을 적용한다.
  • Google Colab TPUs(v2-8)를 사용해 모델을 훈련하며, 배치 크기는 64이고, 최종 과제를 위한 50k번의 미세조정 스텝을 수행한다.
  • 제로-샷 성능 평가를 위해 사전 훈련된 모델을 페르시아어 CommonVoice에 그대로 테스트하고, 피처-샷 성능 평가를 위해 15시간의 데이터로 미세조정한다.

실험 결과

연구 질문

  • RQ1수정된 사전 훈련 목표는 페르시아어 유아 말소리에서 Wav2Vec 2.0의 성능을 향상시킬 수 있는가, 특히 저자원 및 제로-샷 설정에서?
  • RQ2RFP는 RAN 및 MW와 같은 유아 말소리 평가 과제에서 표준 마스킹과 비교해 WER 측면에서 어떻게 성능을 냈는가?
  • RQ3RFP는 페르시아어 ASR에서 제로-샷 및 피처-샷 시나리오에서 모델 일반화 능력을 얼마나 향상시키는가?
  • RQ4RFP를 통한 주파수 도메인 적응은 유아의 높은 형주파수와 넓은 스펙트럼 변동성으로 인한 성능 저하를 완화하는가?
  • RQ5대규모 유아 전사 데이터가 필요 없이, 성인 말소리로 사전 훈련된 자기지도 모델을 RFP를 통해 효과적으로 유아 말소리에 적응시킬 수 있는가?

주요 결과

  • RFP 사전 훈련 목표는 의미 없는 단어(MW) 및 빠른 자동 이름 지정(RAN) 테스트에서 1.35의 단어 오류률(WER)을 기록하여 표준 마스킹보다 뚜렷이 뛰어난 성능을 보였다.
  • CommonVoice의 페르시아어 섹션에서 RFP 모델은 WER 6.45를 기록하여 페르시아어 유아 말소리 인식 분야에서 최신 기술(SOTA) 성능을 달성했다.
  • 제로-샷 평가에서 RFP 모델은 WER 30.48을 기록하여 마스킹 기반 모델(42.30)보다 뛰어난 성능을 보였으며, 도메인 일반화 능력 향상을 시사했다.
  • 피처-샷 시나리오에서 15시간의 CommonVoice 데이터로 RFP 모델을 미세조정하면 50k 스텝에서 WER 10.42를 기록했으며, 마스킹 기반 모델(12.50)을 초월했다.
  • LibriSpeech-960에서의 사전 훈련 과정에서 RFP 모델은 마스킹 목표보다 더 빠르게 수렴하고 더 낮은 WER를 달성했으며, 그림 6에서 이를 확인할 수 있었다.
  • RFP와 마스킹의 조합은 모델의 새로운 환경에 대한 적응 능력을 향상시켜, 다양한 주파수 도메인과 저자원 설정에서 효과적인 성능을 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.