Skip to main content
QUICK REVIEW

[논문 리뷰] Simplified End-to-End MMI Training and Voting for ASR

Lior Fritz, David Burshtein|arXiv (Cornell University)|2017. 03. 30.
Speech Recognition and Synthesis참고 문헌 27인용 수 6
한 줄 요약

이 논문은 경량 언어 모델을 사용한 최대 상호정보량(MMI) 학습을 통해 단순화된 엔드 투 엔드 ASR 시스템을 제안하며, CTC와 유사하게 직접 기울기 기반 학습이 가능하도록 한다. CTC와 달리 높은 품질의 정렬을 생성하여 복수의 독립적으로 학습된 모델의 예측을 평균화하는 간단한 앙상블 방법을 가능하게 한다. WSJ eval92에서 23%의 상대적 단어 오류율 감소와 dev93에서 18.63%의 감소를 달성하였으며, 디코딩 속도는 빠르고 디코더 그래프 크기는 43% 작아졌다.

ABSTRACT

A simplified speech recognition system that uses the maximum mutual information (MMI) criterion is considered. End-to-end training using gradient descent is suggested, similarly to the training of connectionist temporal classification (CTC). We use an MMI criterion with a simple language model in the training stage, and a standard HMM decoder. Our method compares favorably to CTC in terms of performance, robustness, decoding time, disk footprint and quality of alignments. The good alignments enable the use of a straightforward ensemble method, obtained by simply averaging the predictions of several neural network models, that were trained separately end-to-end. The ensemble method yields a considerable reduction in the word error rate.

연구 동기 및 목표

  • 복잡한 하이브리드 HMM-DNN 시스템을 직접적인 MMI 기준으로 대체하여 엔드 투 엔드 ASR 학습을 단순화한다.
  • 효과적인 모델 앙상블를 위해 필수적인 정렬 품질을 CTC보다 향상시킨다.
  • 독립적으로 학습된 모델들의 예측을 평균화하는 간단하고 효과적인 앙상블 방법을 가능하게 한다.
  • CTC 및 하이브리드 시스템과 비교해 디코딩 시간과 디스크 포트를 줄인다.
  • 엔드 투 엔드 학습과 표준 HMM 디코딩을 유지하면서 CTC 수준의 경쟁력 있는 성능을 달성한다.

제안 방법

  • CTC와 유사하게 단일 상태, 문맥 무관 음소 HMM에 단어 간 빈 상태를 포함한다.
  • 학습 중에 단순한 n-gram 언어 모델을 사용해 MMI 기준을 목적 함수로 설정한다.
  • HMM-GMM 시스템의 사전 학습을 피하기 위해 기울기 하강법을 통해 엔드 투 엔드로 모델을 학습한다.
  • 표준 HMM 디코더와 WFST를 사용해 디코딩을 수행하며, 모델의 신뢰할 수 있는 정렬을 활용한다.
  • 복수의 독립적으로 학습된 DNN의 출력 후행 확률을 평균화해 앙상블을 구성하는 투표 방식을 사용한다.
  • 언어 모델을 MMI 목적 함수에 통합해 네트워크가 더 정확한 번역을 향해 유도한다.

실험 결과

연구 질문

  • RQ1단순화된 엔드 투 엔드 MMI 학습 방법이 학습의 단순성은 유지하면서 CTC를 초월하는 성능을 달성할 수 있는가?
  • RQ2제안된 방법이 CTC보다 더 신뢰할 수 있는 정렬을 생성하여 효과적인 모델 평균화를 가능하게 하는가?
  • RQ3후행 확률 평균화에 기반한 단순한 투표 방식이 더 복잡한 디코딩 절차가 필요한 CTC 앙상블을 능가하는가?
  • RQ4CTC 및 하이브리드 시스템과 비교해 이 방법이 얼마나 디코딩 시간과 디스크 포트를 줄이는가?
  • RQ5MMI 목적 함수에 경량 언어 모델을 통합하면 인식 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 EEMMI 방법은 단일 모델 대비 WSJ eval92 세트에서 23%의 상대적 단어 오류율 감소를 달성했으며, WER는 4.22%를 기록했다.
  • dev93 세트에서는 WER가 18.63% 감소해 7.34%의 WER를 달성했다.
  • 디코더 그래프 크기를 CTC 대비 43% 줄여서 디스크 포트를 크게 감소시켰다.
  • CTC 대비 1.38배 빠른 디코딩 속도를 기록했으며, 실시간 요인은 0.0179에서 0.0247로 감소했다.
  • 후행 확률 분산이 감소함으로써 CTC보다 훨씬 더 나은 정렬을 생성했으며, 이는 효과적인 평균화를 가능하게 했다.
  • 더 복잡한 CTC 앙상블 방법에 비해 전체 디코딩 프로세스가 필요 없는 단순한 투표 방식이 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.