Skip to main content
QUICK REVIEW

[논문 리뷰] Experiments of ASR-based mispronunciation detection for children and adult English learners

Nina Hosseini-Kivanani, Roberto Gretter|arXiv (Cornell University)|2021. 04. 13.
Speech Recognition and Synthesis참고 문헌 20인용 수 5
한 줄 요약

이 연구는 이탈리아어를 모국어로 쓰는 영어 학습자들을 대상으로, 일반적인 발음 오류 데이터를 기반으로 훈련된 테이프 수준 오류 언어 모델을 사용하는 ASR 기반의 잘못된 발음 탐지 시스템을 제안한다. 오류 규칙을 언어 모델에 통합함으로써, 성인 및 아동 학습자 모두에서 기준 모델 대비 탐지 정확도를 크게 향상시키며, 테이프 오류율(PER)을 23%로 감소시켰다.

ABSTRACT

Pronunciation is one of the fundamentals of language learning, and it is considered a primary factor of spoken language when it comes to an understanding and being understood by others. The persistent presence of high error rates in speech recognition domains resulting from mispronunciations motivates us to find alternative techniques for handling mispronunciations. In this study, we develop a mispronunciation assessment system that checks the pronunciation of non-native English speakers, identifies the commonly mispronounced phonemes of Italian learners of English, and presents an evaluation of the non-native pronunciation observed in phonetically annotated speech corpora. In this work, to detect mispronunciations, we used a phone-based ASR implemented using Kaldi. We used two non-native English labeled corpora; (i) a corpus of Italian adults contains 5,867 utterances from 46 speakers, and (ii) a corpus of Italian children consists of 5,268 utterances from 78 children. Our results show that the selected error model can discriminate correct sounds from incorrect sounds in both native and nonnative speech, and therefore can be used to detect pronunciation errors in non-native speech. The phone error rates show improvement in using the error language model. The ASR system shows better accuracy after applying the error model on our selected corpora.

연구 동기 및 목표

  • 비모국어자 영어 발화의 음소 수준에서 잘못된 발음을 자동으로 탐지하는 시스템을 개발하기 위해.
  • 이탈리아어 학습자에서 흔히 발생하는 잘못된 발음에서 유도된 오류 규칙을 통합함으로써 L2 학습자의 ASR 정확도를 향상시키기 위해.
  • 오류 언어 모델이 성인 및 아동 학습자 모두에서 올바른 음소와 잘못된 음소를 구별하는 데 얼마나 효과적인지 평가하기 위해.
  • 음소 기반 음성 전사 정보를 기반으로 특정 잘못된 발음 음소를 식별함으로써 학습자에게 실질적인 피드백을 제공하기 위해.

제안 방법

  • 모국어 및 비모국어 발화 데이터를 기반으로 훈련된 청각 모델을 사용하는 Kaldi 기반의 테이프 수준 ASR 프레임워크를 사용한다.
  • 이탈리아어 L2 학습자들의 발음 오류 분석을 통해 유도된 치환, 삭제, 삽입 규칙을 사용하여 오류 언어 모델을 구성한다.
  • 오류 규칙을 수정된 어휘집에 인코딩하여 ASR 시스템이 비모국어 발음을 인식하고 점수를 매길 수 있도록 한다.
  • 모국어 및 비모국어 청각 모델 간의 로그우도 점수를 비교하여 발음 품질을 평가한다.
  • 다양한 언어 모델 구성에서 시스템 성능을 평가하기 위해 주로 테이프 오류율(PER)을 사용한다.
  • 두 개의 코퍼스를 사용한다: 46명의 성인 이탈리아어 학습자로부터 수집한 5,867개 문장과 78명의 어린이 학습자로부터 수집한 5,268개 문장.

실험 결과

연구 질문

  • RQ1오류 최적화된 언어 모델을 갖춘 ASR 시스템이 L2 학습자들의 발화에서 잘못된 음소를 효과적으로 탐지할 수 있는가?
  • RQ2언어 모델에 오류 규칙을 포함시키는 것이 표준 모델 대비 테이프 오류율(PER)에 어떤 영향을 미치는가?
  • RQ3성인 및 아동 학습자 모두에서 인간과 유사한 수준의 음소 수준 오류 탐지 기능을 얼마나 잘 재현할 수 있는가?
  • RQ4이탈리아어 학습자들 사이에서 가장 흔한 잘못된 발음 패턴은 무엇이며, 이를 체계적으로 모델링할 수 있는가?

주요 결과

  • 오류 언어 모델은 성인 및 아동 학습자 코퍼스 모두에서 가장 낮은 테이프 오류율(PER)인 23%를 기록하여 기준 모델을 능가했다.
  • 시스템은 성인 및 비모국어 발화 모두에서 정확한 소리를 잘못된 소리와 구별하는 데 성공하여 연령대 간에 강건한 성능을 보였다.
  • 언어 모델에 오류 규칙을 포함시킴으로써 ASR 정확도가 크게 향상되었으며, 특히 /dh/ → /d/, /n d/ → /n d/, /er/ → /er r/ 와 같은 고빈도 오류 유형에서 두드러진 효과를 보였다.
  • 이전 연구들과 비교해 볼 때 시스템 성능이 뛰어나, 비모국어 발화 데이터에서 보고된 최대 30%의 WER 대비 PER 23%를 기록했다.
  • 예를 들어 'HER'와 같은 단어에 대해 다중 전사 정보를 포함한 수정된 어휘집은 비모국어 변형을 더 잘 인식시켜 피드백 정확도를 향상시켰다.
  • 결과적으로 ASR 기반 시스템은 이탈리아어 배경을 가진 특정 L1에 맞게 효과적으로 맞춤화될 수 있으며, 컴퓨터 지원 발음 훈련(CAPT)의 품질을 향상시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.