[논문 리뷰] A Wav2vec2-Based Experimental Study on Self-Supervised Learning Methods to Improve Child Speech Recognition
이 연구는 자가학습 사전훈련을 통해 wav2vec2를 활용하여 어린이 발성 인식을 향상시키며, 어린이 데이터 10시간 미만으로도 테스트를 수행한다. MyST에서 7.42의 SOTA WER, PFSTAR에서 2.99, CMU KIDS에서 12.47를 기록하여 어린이 데이터가 제한된 상황에서도 wav2vec2 BASE 960을 능가한다.
Despite recent advancements in deep learning technologies, Child Speech Recognition remains a challenging task. Current Automatic Speech Recognition (ASR) models require substantial amounts of annotated data for training, which is scarce. In this work, we explore using the ASR model, wav2vec2, with different pretraining and finetuning configurations for self-supervised learning (SSL) toward improving automatic child speech recognition. The pretrained wav2vec2 models were finetuned using different amounts of child speech training data, adult speech data, and a combination of both, to discover the optimum amount of data required to finetune the model for the task of child ASR. Our trained model achieves the best Word Error Rate (WER) of 7.42 on the MyST child speech dataset, 2.99 on the PFSTAR dataset and 12.47 on the CMU KIDS dataset as compared to any other previous methods. Our models outperformed the wav2vec2 BASE 960 on child speech which is considered a state-of-the-art ASR model on adult speech by just using 10 hours of child speech data in finetuning. The analysis of different types of training data and their effect on inference is also provided by using a combination of datasets in pretraining, finetuning and inference.
연구 동기 및 목표
- 자동 음성 인식(ASR) 분야에서 애초에 애너테이션된 어린이 발성 데이터의 부족 문제를 해결하기 위해.
- wav2vec2의 다양한 사전훈련 및 미세조정 전략이 어린이 ASR에 얼마나 효과적인지 평가하기 위해.
- 미세조정에 사용할 어린이 및 성인 발성 데이터의 최적의 양과 조합을 규명하기 위해.
- MyST, PFSTAR, CMU KIDS를 포함한 다양한 어린이 발성 데이터셋 간의 모델 성능을 비교하기 위해.
- 사전훈련, 미세조정, 추론 단계에서의 데이터 구성이 모델의 강건성에 미치는 영향을 분석하기 위해.
제안 방법
- 다양한 양의 어린이 발성 데이터, 성인 발성 데이터, 혼합 데이터를 사용하여 사전훈련된 wav2vec2 모델을 미세조정하였다.
- 성능에 미치는 영향을 평가하기 위해 사전훈련, 미세조정, 추론 단계에서 다양한 데이터 조합을 탐색하였다.
- 대규모 비라벨 음성 데이터를 사전훈련하여 자기학습을 적용하고, 제한된 라벨이 부여된 어린이 발성 데이터로 미세조정하였다.
- 표준 wav2vec2 아키텍처를 사용하여 대비 사전훈련과 순서-순서 미세조정을 통해 ASR에 적용하였다.
- 표준 WER 평가를 사용하여 MyST, PFSTAR, CMU KIDS 등의 여러 어린이 발성 데이터셋에서 모델을 훈련시켰다.
- 최적의 미세조정 설정을 규명하기 위해 데이터 구성과 양에 대한 분석 실험을 수행하였다.
실험 결과
연구 질문
- RQ1어린이 발성 인식에서 경쟁적인 성능을 달성하기 위해 필요한 어린이 발성 데이터의 최소량은 얼마인가?
- RQ2미세조정 단계에서 어린이 및 성인 발성 데이터를 조합할 경우, 어린이 발성 인식 성능에 어떤 영향을 미치는가?
- RQ3사전훈련, 미세조정, 추론 단계에서의 데이터 구성이 어린이 발성 데이터셋에서의 최종 WER에 어떤 영향을 미치는가?
- RQ4성인 발성 데이터로 사전훈련된 wav2vec2 모델이 최소한의 미세조정만으로도 어린이 발성에서 SOTA 성능을 달성할 수 있는가?
- RQ5사전훈련 및 미세조정 단계에서 다양한 데이터셋 조합이 어린이 발성으로의 일반화에 어떤 영향을 미치는가?
주요 결과
- MyST 어린이 발성 데이터셋에서 최고의 단어 오류율(WER) 7.42를 달성하였다.
- PFSTAR 데이터셋에서 WER 2.99를 기록하여 이전 방법들을 능가하였다.
- CMU KIDS 데이터셋에서 WER 12.47을 기록하여 새로운 SOTA 기준을 수립하였다.
- 어린이 데이터 10시간만으로 미세조정한 모델이 960시간의 성인 발성 데이터로 사전훈련된 wav2vec2 BASE 960 모델을 능가하였다.
- 미세조정 단계에서 어린이 및 성인 데이터를 조합함으로써 다양한 데이터셋에서의 강건성과 일반화 능력이 향상되었다.
- 분석 결과, 사전훈련 및 미세조정 단계에서의 데이터 구성이 어린이 발성에서의 추론 성능에 크게 영향을 미친다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.