Skip to main content
QUICK REVIEW

[논문 리뷰] Accented Speech Recognition: Benchmarking, Pre-training, and Diverse Data

Alëna Aksënova, Zhehuai Chen|arXiv (Cornell University)|2022. 05. 16.
Speech Recognition and Synthesis인용 수 12
한 줄 요약

이 논문은 다양한 외래 발음의 음성 데이터를 기반으로 모델을 벤치마킹하고, wav2vec 2.0의 사전 훈련을 다양한 데이터 유형(예: 합성, 자연스러운, 외래 발음 포함)으로 평가하며, 소외된 언어 자료를 조사하여 포괄적인 자동 음성 인식(ASR)을 발전시킨다. 사전 훈련을 다양한 비모국어 또는 외래 발음 데이터로 수행할 경우, 표준 세트에서의 성능 저하 없이 외래 발음 음성 벤치마크에서 단어 오류율(WER)을 크게 감소시킴을 입증한다. 이는 공정한 ASR 시스템을 위한 데이터 다양성과 강력한 사전 훈련의 중요성을 강조한다.

ABSTRACT

Building inclusive speech recognition systems is a crucial step towards developing technologies that speakers of all language varieties can use. Therefore, ASR systems must work for everybody independently of the way they speak. To accomplish this goal, there should be available data sets representing language varieties, and also an understanding of model configuration that is the most helpful in achieving robust understanding of all types of speech. However, there are not enough data sets for accented speech, and for the ones that are already available, more training approaches need to be explored to improve the quality of accented speech recognition. In this paper, we discuss recent progress towards developing more inclusive ASR systems, namely, the importance of building new data sets representing linguistic diversity, and exploring novel training approaches to improve performance for all users. We address recent directions within benchmarking ASR systems for accented speech, measure the effects of wav2vec 2.0 pre-training on accented speech recognition, and highlight corpora relevant for diverse ASR evaluations.

연구 동기 및 목표

  • ASR 시스템에서 외래 발음 및 다양한 음성에 대한 대표성 있는 데이터와 벤치마크의 부족을 해결하기 위해.
  • 비모국어 및 지역 발음에 대한 인식 성능에 영향을 미치는 다양한 wav2vec 2.0 사전 훈련 전략의 영향을 평가하기 위해.
  • 사회어, 비모국어 사용자, 언어 장애를 포함한 언어 다양성을 반영하는 기존 자료를 식별하고 조사하기 위해.
  • 데이터 기반 사전 훈련 및 평가 방법론을 통해 소외된 음성 유형에 대한 모델의 강건성을 향상시키기 위해.
  • 연구자, 언어학자, 지역 사회 간의 협력을 촉진하여 데이터 수집을 확장하고 ASR의 공정성을 향상시키기 위해.

제안 방법

  • 아프리카계 미국인 영어(AAVE), 비모국어 영어, 지역 발음을 반영하는 여러 테스트 세트를 사용해 ASR 시스템을 벤치마킹한다.
  • 다양한 데이터 소스에서 wav2vec 2.0 사전 훈련을 평가한다: Libri-Light, YT-U(유튜브 무 supervision), 외래 발음 일반화를 위한 합성 음성.
  • 노이즈 있는 스터디(self-training, NST)를 적용하여 외래 발음 음성 데이터로 모델을 미세 조정함으로써, 표준 세트에서의 WER 증가 없이 일반화 능력을 향상시킨다.
  • 성별, 지역, 언어 유형과 같은 인구통계학적 및 언어학적 변수를 기반으로 모델 성능을 분석하여 편향의 원인을 규명한다.
  • 언어 다양성(예: AAVE, 비모국어 발음, 언어 장애, 사회어 등)을 기반으로 공개된 자료를 조사하고 분류한다.
  • 다양한 언어학적 및 음향적 차원에서 인식 오류를 다각도로 분석할 수 있도록 광범위한 메타데이터 애너테이션을 사용한다.

실험 결과

연구 질문

  • RQ1다양한 비모국어 또는 외래 발음 데이터로 wav2vec 2.0 사전 훈련을 수행할 경우, 외래 발음 음성 벤치마크에서 ASR 성능에 어떤 영향을 미치는가?
  • RQ2자연스러운, 합성, 또는 무 supervision 데이터 유형이 비모국어 및 지역 발음에 대한 인식 정확도에 어떤 영향을 미치는가?
  • RQ3AAVE, 비모국어 사용자, 언어 장애를 포함한 소외된 언어 유형을 가장 잘 반영하는 기존 자료는 무엇인가?
  • RQ4지역, 성별, 발음 등 인구통계학적 및 언어학적 요인에 따라 모델 성능이 얼마나 다를지, 그리고 이러한 요소들을 벤치마킹에서 어떻게 분리할 수 있는가?
  • RQ5협업 기반의 데이터 수집 및 메타데이터 애너테이션은 다양한 음성 유형에 대한 ASR 시스템의 공정성과 강건성을 어떻게 향상시킬 수 있는가?

주요 결과

  • YT-U(유튜브 무 supervision 데이터)로 사전 훈련한 결과, GMU Accent 테스트 세트에서 WER가 5.4%에서 4.0%로 감소하였다.
  • YT-U 사전 훈련에 노이즈 있는 스터디(self-training, NST)를 적용한 결과, GMU Accent에서 WER는 4.0%, CORAAL:ATL에서는 12.5%, CORAAL:DCB에서는 14.0%로 추가로 감소하였다.
  • 합성 또는 자연스러운 음성 데이터로 사전 훈련한 결과, 표준 벤치마크에서의 WER 증가 없이 외래 발음 음성 인식 성능이 향상되어 강건성과 일반화 능력이 입증되었다.
  • CORAAL 자료는 AAVE의 지역적 변동성이 뚜렷하게 나타났으며, 다양한 메트로폴리탄 지역 간 WER 범위는 16.6%에서 24.7%까지 다양했다.
  • IFCASL, Euphonia, Whitaker 자료는 비모국어 및 언어 장애가 있는 음성에 대한 중요한 데이터를 제공하지만, 여전히 커버리지가 제한되어 있다.
  • 본 연구는 현재의 벤치마크가 언어 다양성을 충분히 반영하지 못해 인구통계학적 및 언어학적 그룹 간에 은폐된 성능 격차를 초래하고 있음을 밝혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.