Skip to main content
QUICK REVIEW

[논문 리뷰] The Microsoft 2016 Conversational Speech Recognition System

Wayne Xiong, Jasha Droppo|arXiv (Cornell University)|2016. 09. 12.
Speech Recognition and Synthesis참고 문헌 29인용 수 16
한 줄 요약

이 논문은 2016년 마이크로소프트의 대화형 음성 인식 시스템을 제시하며, 딥 컨volution 신경망(CNN), 양방향 LSTM, i-벡터 적응, 레이어드-프리 maximum mutual information(LFMMI) 학습, 앙상블 방법 및 양방향 RNN 언어 모델을 통합한다. 이 시스템은 NIST 2000 Switchboard 테스트 세트에서 6.2%의 단어 오류율(WER)을 달성하였으며, 이는 모델 조합과 ResNet 및 주목적 기반 LACE를 포함한 고급 신경망 아키텍처를 통해 당시 최고의 성능이었다.

ABSTRACT

We describe the 2017 version of Microsoft's conversational speech recognition system, in which we update our 2016 system with recent developments in neural-network-based acoustic and language modeling to further advance the state of the art on the Switchboard speech recognition task. The system adds a CNN-BLSTM acoustic model to the set of model architectures we combined previously, and includes character-based and dialog session aware LSTM language models in rescoring. For system combination we adopt a two-stage approach, whereby subsets of acoustic models are first combined at the senone/frame level, followed by a word-level voting via confusion networks. We also added a confusion network rescoring step after system combination. The resulting system yields a 5.1\% word error rate on the 2000 Switchboard evaluation set.

연구 동기 및 목표

  • 딥 네ural 네트워크와 앙상블 기법을 통합함으로써 대화형 음성 인식 분야의 최첨단 기술을 발전시키기.
  • ResNet과 주목적 기반 LACE를 포함한 고급 CNN 아키텍처를 통해 음성 모델링을 향상시키기.
  • 양방향 RNNLM과 단어 후행 기반 시스템 조합을 통해 언어 모델링을 향상시키기.
  • 엔드 투 엔드 학습 및 재평가 기법을 통해 Switchboard 벤치마크에서 단어 오류율(WER)을 감소시키기.
  • 신경 음성 모델에서 레이어드-프리 MMI 학습과 i-벡터 적응의 효과를 입증하기.

제안 방법

  • VGG, ResNet, 그리고 계층적 컨텍스트 확장과 주목적 기반을 포함한 LACE를 포함한 다양한 CNN 및 LSTM 음성 모델 아키텍처를 사용하는 하이브리드 시스템을 구현한다.
  • 학습 가능한 가중치 행렬을 통해 CNN 레이어에 말자체 특성 임베딩을 삽입하고 LSTM 입력에 추가함으로써 말자체 특성 기반 i-벡터 적응을 적용한다.
  • 음성 모델을 맥락 의존적 음소 상태와 후행 확률과 함께 동시에 최적화하기 위해 레이어드-프리 최대 상호정보량(LFMMI) 학습을 활용한다.
  • n-그램 일반화를 향상시키기 위해 정방향 및 역방향 양방향 RNN 언어 모델(RNNLM)을 양방향으로 학습한다.
  • 다중 모델 조합을 위해 혼란 네트워크 조합과 최적의 시스템 조합을 탐색하는 기법을 적용하며, 단어 후행을 활용해 강건성을 향상시킨다.
  • 외부 도메인 데이터를 효과적으로 통합하기 위해 이중 단계 RNNLM 학습 프로토콜을 도입하여 일반화 능력과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1잔차 연결과 주목적 기반 메커니즘을 갖춘 딥 CNN은 대화형 음성 인식에서 기존 DNN 및 LSTM보다 우월한 성능을 낼 수 있는가?
  • RQ2전통적인 교차 엔트로피 및 레이어드 기반 방법과 비교해 레이어드-프리 MMI 학습이 음성 모델 성능 향상에 얼마나 효과적인가?
  • RQ3i-벡터 적응은 CNN 및 LSTM을 포함한 다양한 음성 모델 아키텍처 전반에서 성능 향상에 얼마나 기여하는가?
  • RQ4양방향 RNNLM과 다중 시스템 조합은 Switchboard 작업에서 단어 오류율 감소에 어떤 영향을 미치는가?
  • RQ5다양한 음성 모델과 언어 모델을 조합하는 앙상블 기법이 NIST 2000 Switchboard 벤치마크에서 최첨단 성능을 달성할 수 있는가?

주요 결과

  • 최고의 단일 시스템은 RNNLM 재평가를 적용한 ResNet 기반 음성 모델을 사용하여 NIST 2000 Switchboard 테스트 세트에서 6.9%의 단어 오류율(WER)을 달성하였다.
  • 최종 조합된 시스템은 다수의 음성 모델과 언어 모델을 통합하여 6.2%의 WER를 기록하였으며, 이는 최고의 단일 시스템 대비 20%의 상대적 오류 감소를 의미한다.
  • i-벡터 적응은 CNN 및 LSTM을 포함한 모든 음성 모델 유형에서 상대적으로 5–8%의 WER 향상을 제공하였다.
  • LFMMI 학습은 모든 모델에서 일관되게 7–10%의 상대적 WER 감소를 이끌어내어 기존 교차 엔트로피 학습 대비 효과성을 입증하였다.
  • 정방향 및 역방향 모델을 사용한 RNNLM 재평가 기법은 최고의 단일 시스템에서 20%의 상대적 오류 감소를 이끌어내어 양방향 언어 모델링의 가치를 입증하였다.
  • 혼란 네트워크 조합과 부분집합 탐색을 활용한 시스템 조합 과정은 최고의 개별 시스템 대비 16%의 상대적 WER 향상을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.