Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation For Children's Speech Recognition -- The "Ethiopian" System For The SLT 2021 Children Speech Recognition Challenge

Guoguo Chen, Xingyu Na|arXiv (Cornell University)|2020. 11. 09.
Speech Recognition and Synthesis참고 문헌 21인용 수 11
한 줄 요약

이 논문은 SLT 2021 어린이 음성 인식 도전 대회에서 'Ethiopian' 시스템을 제안하며, 어린이 음성 학습 데이터의 부족 문제를 해결하기 위해 피치, 템포, 속도, 볼륨 및 리버버버션 변형을 포함한 포괄적인 데이터 증강 기법의 세트를 제시한다. 이 시스템은 엔드 투 엔드 어텐션 기반 인코더-디코더 모델을 기반으로 한 ESPnet에 기반하며, 트랙 2에서 16.53% CER(1위), 트랙 1에서 후보 분석 결과 18.82% CER를 기록하여 최신 기술 수준의 성능을 달성하였다. 이는 다양한 툴킷과 아키텍처에서 어린이 음성 인식의 정확성과 내성 향상에 데이터 증강 기법이 크게 기여한다는 것을 보여준다.

ABSTRACT

This paper presents the "Ethiopian" system for the SLT 2021 Children Speech Recognition Challenge. Various data processing and augmentation techniques are proposed to tackle children's speech recognition problem, especially the lack of the children's speech recognition training data issue. Detailed experiments are designed and conducted to show the effectiveness of each technique, across different speech recognition toolkits and model architectures. Step by step, we explain how we come up with our final system, which provides the state-of-the-art results in the SLT 2021 Children Speech Recognition Challenge, with 21.66% CER on the Track 1 evaluation set (4th place overall), and 16.53% CER on the Track 2 evaluation set (1st place overall). Post-challenge analysis shows that our system actually achieves 18.82% CER on the Track 1 evaluation set, but we submitted the wrong version to the challenge organizer for Track 1.

연구 동기 및 목표

  • 음성 인식 시스템에서 어린이 음성 학습 데이터의 부족 문제를 해결하기 위함.
  • 어린이 음성의 음향적 및 언어적 변동성에 대한 모델의 내성 향상.
  • 다양한 데이터 증강 기법이 여러 음성 인식 툴킷(Kaldi 및 ESPnet)과 모델 아키텍처에서 효과적으로 작용하는지 평가하기 위함.
  • SLT 2021 어린이 음성 인식 도전 대회에서 최신 기술 수준의 성능 달성.
  • 데이터 증강의 영향을 모델 일반화 능력과 오류 감소 측면에서 체계적으로 분석하기 위함.

제안 방법

  • 어린이 음성 학습을 위한 데이터 확장을 위해 피치 변형, 템포 변형, 속도 변형, 볼륨 변형 및 리버버버션 증강을 적용함.
  • 비교 평가를 위해 Kaldi의 체인 모델과 ESPnet의 엔드 투 엔드 어텐션 기반 인코더-디코더 모델을 사용함.
  • 다양한 파라미터(예: 속도 및 템포의 경우 0.85–1.15)를 활용한 데이터 증강을 통해 다양한 말하기 스타일과 음성 특성을 시뮬레이션함.
  • 각 증강 기법의 모델 성능에 미치는 영향을 분리하여 분석하기 위해 아블레이션 스터디를 수행함.
  • 검증 손실 기반으로 상위 8개 체크포인트를 평균화한 결과를 활용해 모델를 다시 훈련함.
  • 모델 훈련 이전에 훈련 및 검증 세트에 대해 텍스트 정규화 및 토큰화를 수행함.

실험 결과

연구 질문

  • RQ1다양한 데이터 증강 기법이 어린이 음성 인식 성능 향상에 얼마나 효과적인가?
  • RQ2데이터 증강이 다양한 음성 인식 툴킷(Kaldi 대비 ESPnet)과 모델 아키텍처 간의 일반화 능력을 향상시키는가?
  • RQ3데이터 증강이 제한된 어린이 음성 학습 데이터와 음향적 변동성의 영향을 완화하는 데 기여하는가?
  • RQ4최적의 인식 정확도를 달성하기 위해 최적의 증강 파라미터 조합은 무엇인가?
  • RQ5증강된 어린이 음성 데이터 환경에서 엔드 투 엔드 모델의 성능가 전통적 체인 모델 대비 어떻게 다른가?

주요 결과

  • 최종 ESPnet 기반 시스템은 트랙 2 평가 세트에서 16.53% CER를 기록하여 SLT 2021 도전 대회에서 전체 1위를 차지함.
  • 도전 후 분석 결과, 시스템은 트랙 1 평가 세트에서 18.82% CER를 기록하였지만, 잘못된 제출 버전으로 인해 21.66% CER 결과를 기록함.
  • 데이터 증강은 모델의 내성 향상에 크게 기여하였으며, 최적의 증강 설정을 적용한 경우 검증 세트에서 CER를 16.28%(기준 Kaldi)에서 13.61%로 감소시킴.
  • 엔드 투 엔드 ESPnet 모델은 동일한 증강 조건에서 Kaldi 체인 모델보다 우수한 성능을 보였으며, 검증 세트에서 평균 CER 14.95%를 기록한 반면 Kaldi는 15.81%를 기록함.
  • 실험 결과, 특히 어린이 음성(Set C1 및 C2) 데이터를 더 많이 증강할 경우 성능 향상이 뚜렷하게 나타났으며, 도전 후 분석에서 Exp12가 Exp11보다 우수한 성능을 기록함.
  • 볼륨 및 리버버버션 변형은 속도 및 템포 변형과 조합했을 때 특히 CER 감소에 효과적이었음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.