Skip to main content
QUICK REVIEW

[논문 리뷰] Data augmentation using prosody and false starts to recognize non-native children's speech

Hemant Kumar Kathania, Mittul Singh|arXiv (Cornell University)|2020. 08. 29.
Speech Recognition and Synthesis참고 문헌 20인용 수 15
한 줄 요약

이 논문은 자료 부족과 잘못된 시작(가장자리) 문제를 해결하기 위해 음성 강조 기반 오디오 증강과 언어 모델링에서 부분 단어 노이즈를 결합한 데이터 증강 방법을 제안한다. 이는 비모국어인 어린이의 음성 인식을 향상시키기 위한 것으로, 후처리 평가 개선 후 단어 오류율(WER)이 17.99%를 기록하여 INTERSPEECH 2020 공동 과제에서 3위를 차지했다.

ABSTRACT

This paper describes AaltoASR's speech recognition system for the INTERSPEECH 2020 shared task on Automatic Speech Recognition (ASR) for non-native children's speech. The task is to recognize non-native speech from children of various age groups given a limited amount of speech. Moreover, the speech being spontaneous has false starts transcribed as partial words, which in the test transcriptions leads to unseen partial words. To cope with these two challenges, we investigate a data augmentation-based approach. Firstly, we apply the prosody-based data augmentation to supplement the audio data. Secondly, we simulate false starts by introducing partial-word noise in the language modeling corpora creating new words. Acoustic models trained on prosody-based augmented data outperform the models using the baseline recipe or the SpecAugment-based augmentation. The partial-word noise also helps to improve the baseline language model. Our ASR system, a combination of these schemes, is placed third in the evaluation period and achieves the word error rate of 18.71%. Post-evaluation period, we observe that increasing the amounts of prosody-based augmented data leads to better performance. Furthermore, removing low-confidence-score words from hypotheses can lead to further gains. These two improvements lower the ASR error rate to 17.99%.

연구 동기 및 목표

  • 제한된 번역된 데이터와 자발적인 언어 현상으로 인해 자원이 부족한 비모국어 어린이의 음성 인식 과제를 해결한다.
  • 9–16세 연령대 간의 청각적 변동성과 어린이의 영어 비모국어 발음 패턴을 극복한다.
  • 테스트 세트에서는 명시적으로 번역되지만 훈련 중에 보이지 않는 잘못된 시작과 부분 단어에 대해 ASR의 강인성을 향상시킨다.
  • 외부 자원 없이도 음성 모델링과 언어 모델링 구성 요소를 모두 향상시키는 데이터 증강 전략을 개발한다.
  • 비모국어 어린이의 음성 인식에 있어 INTERSPEECH 2020 공동 과제에서 최고 성능을 달성한다.

제안 방법

  • TSM 기반 알고리즘을 사용하여 음고와 말하기 속도를 수정함으로써 연령대 변동을 시뮬레이션하는 음성 강조 기반 데이터 증강을 적용한다.
  • SpecAugment와의 비교를 통해 음성 강조 기반 증강이 어린이의 음성 변동성을 더 잘 포착하는 것으로 밝혀졌다.
  • 기존 단어를 조각으로 나누어 언어 모델링 데이터에 부분 단어 노이즈를 도입하여 잘못된 시작을 시뮬레이션한다.
  • 증강된 오디오 데이터를 사용해 음성 모델을 훈련하고, 원본, 비정규화된, 노이즈가 가미된 텍스트로 훈련된 통합 언어 모델을 결합한다.
  • 낮은 신뢰도 점수를 가진 단어를 ASR 추론 결과에서 제거하는 신뢰도 점수 필터링 메커니즘을 구현하여, 비영어 또는 불완전한 출력으로 인한 오류를 줄인다.
  • 다양한 시스템(예: SR2-P2 + 신뢰도 필터링)을 조합하여 앙상블 디코딩을 통해 WER를 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1음성 강조 기반 데이터 증강이 비모국어 어린이의 음성 인식에서 표준 SpecAugment를 능가할 수 있는가?
  • RQ2언어 모델링 데이터에 부분 단어 노이즈를 도입하면 잘못된 시작과 불완전한 표현에 대한 ASR 성능에 어떤 영향을 미치는가?
  • RQ3음성 강조 기반 증강 데이터의 양을 늘일수록 일관된 성능 향상이 이루어지는가? 이는 SpecAugment의 스케일링과 비교해 볼 때 어떻게 다른가?
  • RQ4신뢰도 점수 필터링이 낮은 신뢰도의 추론 결과를 제거함으로써 WER를 향상시킬 수 있는가? 특히 비영어 또는 조각 난 단어에 대해선 어떤가?
  • RQ5자원이 부족한 비모국어 어린이의 음성 인식 환경에서 가장 낮은 WER를 달성하기 위해 최적의 데이터 증강 및 필터링 기법 조합은 무엇인가?

주요 결과

  • 음성 강조 기반 증강 데이터로 훈련된 음성 모델은 기준 레시피나 SpecAugment를 사용한 모델보다 우수한 성능을 보였으며, 평가 기간 동안 WER가 18.71%를 기록했다.
  • 음성 강조 기반 증강 데이터의 양을 늘일수록 일관된 성능 향상이 있었지만, SpecAugment 데이터의 증가는 결과를 악화시켜 과적합 또는 증강 불일치 문제를 시사했다.
  • 언어 모델링 데이터에 부분 단어 노이즈를 도입함으로써 통합 언어 모델의 성능이 향상되었으며, 특히 복합 시스템 설정에서 두드러졌다.
  • 신뢰도 점수 필터링 메커니즘이 낮은 신뢰도의 단어를 제거하여 후처리 평가 실험에서 최종 오류율을 17.99%로 낮추는 데 기여했다.
  • SR2-P2 증강, 노이즈가 가미된 언어 모델, 그리고 신뢰도 필터링을 조합한 복합 시스템이 가장 낮은 WER 17.99%를 기록하여 다중 구성 요소 기반 데이터 증강의 효과를 입증했다.
  • 제안된 음성 강조 증강 및 잘못된 시작 시뮬레이션 기법은 공개적으로 배포되어 재현성과 어린이의 음성 인식 분야의 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.