[논문 리뷰] Adaptation of Whisper models to child speech recognition
이 논문은 다국어 Whisper ASR 모델을 어린이 발성에 대해 미세조정하여 인식 성능을 향상시키는 것을 조사한다. 어린이 발성에 대해 Whisper를 미세조정하면 원본 모델 대비 상당한 ASR 성능 향상을 보이며, 자율학습된 wav2vec2 모델이 어린이 데이터에 대해 미세조정된 경우 양자 모두를 능가하는 것으로 나타났다.
Automatic Speech Recognition (ASR) systems often struggle with transcribing child speech due to the lack of large child speech datasets required to accurately train child-friendly ASR models. However, there are huge amounts of annotated adult speech datasets which were used to create multilingual ASR models, such as Whisper. Our work aims to explore whether such models can be adapted to child speech to improve ASR for children. In addition, we compare Whisper child-adaptations with finetuned self-supervised models, such as wav2vec2. We demonstrate that finetuning Whisper on child speech yields significant improvements in ASR performance on child speech, compared to non finetuned Whisper models. Additionally, utilizing self-supervised Wav2vec2 models that have been finetuned on child speech outperforms Whisper finetuning.
연구 동기 및 목표
- 제한된 어린이 발성 데이터셋으로 인해 어린이 발성에서 낮은 ASR 성능을 보이는 문제를 해결하기 위해.
- Whisper와 같은 사전학습된 다국어 ASR 모델이 제한된 미세조정 데이터를 사용해 어린이 발성에 효과적으로 적응할 수 있는지 조사하기 위해.
- 어린이 발성 인식에서 미세조정된 Whisper 모델의 성능을 wav2vec2와 같은 자율학습 모델의 성능과 비교하기 위해.
- 저자원 환경에서 성인 발성 사전학습에서 어린이 발성 적응으로의 전이학습의 효과를 평가하기 위해.
제안 방법
- 어린이 발성 특성에 맞추어 미세조정하기 위해, 정제된 어린이 발성 데이터셋을 기반으로 사전학습된 Whisper base 및 large 모델을 미세조정한다.
- Whisper의 초기 모델 가중치 확보를 위해 사전학습에 사용된 기존의 대규모 성인 발성 데이터셋을 활용한다.
- 비교적 성능 평가를 위해 동일한 어린이 발성 데이터에 대해 자율학습된 wav2vec2 모델을 미세조정한다.
- 미세조정 중 표준 ASR 학습 절차를 적용한다: 스펙트럼 증강, 학습률 스케줄링, 조기 정지.
- 모든 모델을 보유한 어린이 발성 테스트 세트에서 표준 ASR 메트릭(예: 단어 오류율(WER))을 사용해 평가한다.
- 가능한 한 동일한 초모수 및 데이터 분할을 사용하여 공정한 비교를 확보한다.
실험 결과
연구 질문
- RQ1Whisper 모델을 어린이 발성에 대해 미세조정하면 원본 사전학습 모델 대비 상당한 ASR 성능 향상이 이루어지는가?
- RQ2동일한 어린이 발성 데이터에 대해 미세조정된 Whisper의 성능은 자율학습된 wav2vec2 모델의 성능에 비해 어떻게 비교되는가?
- RQ3제한된 어린이 데이터에 대해 성인 발성 사전학습에서 전이학습을 수행할 경우, 어린이 발성 인식에 얼마나 기여하는가?
- RQ4모델 아키텍처와 사전학습 데이터 분포가 어린이 발성 인식 정확도에 미치는 상대적 영향은 무엇인가?
주요 결과
- Whisper를 어린이 발성에 대해 미세조정하면 비미세조정 기반 모델 대비 단어 오류율(WER)이 상당히 감소한다.
- 미세조정된 Whisper 모델은 원본 Whisper 모델보다 어린이 발성에서 뚜렷한 성능 향상을 보이며, 어린이 발성 특성에 효과적으로 적응하고 있음을 입증한다.
- 자율학습된 wav2vec2 모델이 어린이 발성 데이터에 대해 미세조정된 경우, 원본 및 미세조정된 Whisper 모델을 모두 능가하는 성능을 기록한다.
- Whisper와 wav2vec2 간의 성능 격차는 어린이 전용 데이터에 대해 자율학습 사전학습을 수행함으로써 최종 ASR 작업에서의 이점이 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.