Skip to main content
QUICK REVIEW

[논문 리뷰] Error Correction in ASR using Sequence-to-Sequence Models

Samrat Dutta, Shreyansh Jain|arXiv (Cornell University)|2022. 02. 02.
Speech Recognition and Synthesis인용 수 10
한 줄 요약

이 논문은 합성 및 실제 ASR 오류를 사용하여 미세조정된 BART 모델인 RoBART를 제안한다. 음소 시퀀스와 증강 데이터에 대한 적응형 훈련을 활용하여, 비표준 발음 말하기에서 상당한 WER 감소를 달성하지만, 제한된 문맥 포착으로 인해 문법 오류 보정에서는 성능이 열 劣하다.

ABSTRACT

Post-editing in Automatic Speech Recognition (ASR) entails automatically correcting common and systematic errors produced by the ASR system. The outputs of an ASR system are largely prone to phonetic and spelling errors. In this paper, we propose to use a powerful pre-trained sequence-to-sequence model, BART, further adaptively trained to serve as a denoising model, to correct errors of such types. The adaptive training is performed on an augmented dataset obtained by synthetically inducing errors as well as by incorporating actual errors from an existing ASR system. We also propose a simple approach to rescore the outputs using word level alignments. Experimental results on accented speech data demonstrate that our strategy effectively rectifies a significant number of ASR errors and produces improved WER results when compared against a competitive baseline. We also highlight a negative result obtained on the related grammatical error correction task in Hindi language showing the limitation in capturing wider context by our proposed model.

연구 동기 및 목표

  • 음운적 혼동, 철자 오류, 단어 경계 오류와 같은 일반적이고 체계적인 ASR 오류를 보정하는 데 도전하는 것.
  • ASR 오류 보정을 위한 감독 훈련 데이터 부족 문제를 해결하기 위해 합성 오류 데이터를 생성하는 것.
  • ASR-유사 오류로 미세조정된 사전 훈련된 시퀀스-투-시퀀스 모델(BART)을 사용하여 ASR 출력 품질을 향상시키는 것.
  • 모델의 일반화 능력을 인도어 문법 오류 보정(GEC) 작업에서 평가하여 그 한계를 부각하는 것.

제안 방법

  • 합성 ASR 오류와 실제 ASR 가설의 조합에 대해 사전 훈련된 BART 모델을 미세조정하여 음성 기반 오류 패tern에 적응시키는 것.
  • 기본 번역문에 음운적으로 타당한 편집(예: 문자 삭제, 치환, 단어 경계 이동)을 적용하여 합성 훈련 데이터를 생성하는 것.
  • 오류 탐지 및 수정 능력을 향상시키기 위해 음소 시퀀스를 보조 입력으로 통합하는 것.
  • 단어 수준의 정렬을 사용하여 ASR 시스템과 RoBART 모델의 출력을 재평가하고 통합하여 최종 번역 품질을 향상시키는 것.
  • 무작위 마스킹과 오류 중심 마스킹 전략을 사용하여 mBART 모델을 인도어 문법 오류 보정에 적응시키는 것.
  • 비교를 위해 비현수와의 성능 평가를 위해 비표준 말하기에서 WER와 인도어 GEC 데이터셋에서 GLEU를 사용하는 것.

실험 결과

연구 질문

  • RQ1BART와 같은 사전 훈련된 시퀀스-투-시퀀스 모델이 합성 및 실제 오류 데이터를 사용하여 일반적인 ASR 오류를 효과적으로 미세조정할 수 있는가?
  • RQ2입력으로 음소 시퀀스를 통합할 경우 ASR 오류 보정 성능에 어떤 영향을 미치는가?
  • RQ3제안된 데이터 증강 전략이 비표준 말하기 데이터에서 단어 오류율(WER)을 상당히 감소시키는가?
  • RQ4동일한 모델 아키텍처가 문법 오류 보정으로 일반화될 수 있는가, 만약 그렇지 않다면 그 이유는 무엇인가?
  • RQ5문맥 인식은 음운적 오류(ASR)와 형태적 오류(GEC)를 구분하는 데 어떤 역할을 하는가?

주요 결과

  • RoBART 모델은 합성 및 실제 ASR 오류로의 미세조정을 통해 비표준 말하기 데이터에서 상당한 WER 감소를 달성한다.
  • ASR 가설과 RoBART 출력을 단어 수준의 정렬과 재평가를 통해 통합함으로써 번역 품질을 추가로 향상시킬 수 있다.
  • 철자 오류, 문자 삭제, 단어 경계 혼동과 같은 음운적으로 유도된 오류에 대해 모델은 잘 작동한다.
  • 인도어 문법 오류 보정 작업에서 mBART 기반 모델은 베이스라인에 비해 성능이 열 劣하며, 특히 형태적 및 문법적 오류에서 그렇다.
  • GEC에서의 실패는 국소적 어휘 오류에서는 강력한 성능를 보였음에도 불구하고, 넓은 문맥 의존성 포착에 실패했기 때문으로 기인한다.
  • 미세조정 중 오류 중심 마스킹이 단순 무작위 마스킹보다 성능 향상에 기여하지 않았으며, 이는 문맥 모델링이 오류 특화 마스킹보다 더 중요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.