Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Spelling Correction with Transformer for CTC-based End-to-End Speech Recognition

Shiliang Zhang, Ming Lei|arXiv (Cornell University)|2019. 03. 27.
Speech Recognition and Synthesis참고 문헌 25인용 수 9
한 줄 요약

이 논문은 CTC 기반의 일체형 중국어 음성 인식에서 특히 동음이의어 오류를 수정하는 Transformer 기반 철자 교정 모델을 제안한다. 인코더-디코더 아키텍처를 사용하여 CTC 인식 출력과 참조 전사문을 훈련시킴으로써, 문자 오류율(CER)을 3.41%로 감소시켜 언어 모델링을 사용한 기준 CTC 시스템 대비 22.9% 상대적 향상을 달성한다.

ABSTRACT

Connectionist Temporal Classification (CTC) based end-to-end speech recognition system usually need to incorporate an external language model by using WFST-based decoding in order to achieve promising results. This is more essential to Mandarin speech recognition since it owns a special phenomenon, namely homophone, which causes a lot of substitution errors. The linguistic information introduced by language model will help to distinguish these substitution errors. In this work, we propose a transformer based spelling correction model to automatically correct errors especially the substitution errors made by CTC-based Mandarin speech recognition system. Specifically, we investigate using the recognition results generated by CTC-based systems as input and the ground-truth transcriptions as output to train a transformer with encoder-decoder architecture, which is much similar to machine translation. Results in a 20,000 hours Mandarin speech recognition task show that the proposed spelling correction model can achieve a CER of 3.41%, which results in 22.9% and 53.2% relative improvement compared to the baseline CTC-based systems decoded with and without language model respectively.

연구 동기 및 목표

  • 동음이의어로 인한 CTC 기반 중국어 음성 인식에서의 높은 교체 오류 비율을 해결하기 위해.
  • 외부 언어 모델이나 복잡한 디코딩에 의존하지 않고도 인식 성능을 향상시키기 위해.
  • 문장 수준의 맥락을 활용한 오류 교정을 위한 후처리 철자 교정 시스템을 개발하기 위해.
  • 데이터 증강을 통한 N-best 목록 확장과 훈련 최적화(SGDR)를 통해 모델의 일반화 능력을 향상시키기 위해.

제안 방법

  • CTC 생성 인식 출력을 입력으로, 참조 전사문을 타겟으로 하여 Transformer 인코더-디코더 모델을 훈련한다.
  • CTC 모델 출력에 대해 탐욕적 검색 추론을 사용하여 철자 교정 모델의 입력으로 활용한다.
  • WFST 기반 디코딩에서의 N-best 목록 디코딩을 활용하여 훈련 데이터의 다양성을 확장하며, 상위 1, 5, 10개의 가설을 사용한다.
  • 수렴성과 성능 향상을 위해 다중 패assing 훈련을 위한 SGDR(스토캐스틱 그래디언트 디센트 및 웜 리셋)를 적용한다.
  • 다양한 프론트엔드 CTC 시스템(예: DFSMN-CTC-sMBR)과 디코딩 전략과 함께 철자 교정 모델을 통합한다.
  • 다양한 CTC 모델 변종과 최적화 기준에서의 데이터를 사용하여 철자 교정 모델을 피취기닝한다.

실험 결과

연구 질문

  • RQ1Transformer 기반의 철자 교정 모델은 CTC 기반 중국어 음성 인식에서 교체 오류를 효과적으로 줄일 수 있는가?
  • RQ2N-best 목록을 활용한 데이터 증강은 철자 교정 모델의 성능에 어떤 영향을 미치는가?
  • RQ3SGDR 기반의 다중 패assing 훈련은 철자 교정 모델의 수렴성과 정확도를 어느 정도 향상시킬 수 있는가?
  • RQ4더 약한 CTC 기반 시스템에서는 철자 교정 모델이 더 큰 상대적 향상도를 달성하는가?
  • RQ5WFST 기반 디코딩과 외부 언어 모델링을 사용한 강력한 CTC-sMBR 시스템을 초월할 수 있는가?

주요 결과

  • 철자 교정 모델은 기준 CTC 시스템(탐욕적 검색)의 CER 7.28%를 4.89%로 감소시켰다.
  • N-best 목록 데이터 확장을 활용하면 CER가 4.21%로 향상되어 WFST 디코딩을 사용한 CTC-sMBR 시스템(4.42% CER)을 초월했다.
  • 최종 모델은 DFSMN-CTC-sMBR와 N-best 데이터 확장을 결합하여 CER 3.41%를 달성하였으며, 언어 모델링을 사용한 CTC 시스템 대비 22.9% 상대적 향상을 이룩했다.
  • 언어 모델링을 사용하지 않은 CTC 시스템 대비 53.2% 상대적 향상을 달성하여 강력한 오류 교정 능력을 입증했다.
  • 오류 분석 결과, 문장 수준의 맥락을 활용함으로써 특히 동음이의어 관련 오류가 크게 감소함을 확인했다.
  • 초기 오류율이 높은 기반 시스템에서 더 나은 성능을 보이며, 오류가 더 흔한 환경에서 더 큰 교정 잠재력을 지닌다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.