Skip to main content
QUICK REVIEW

[논문 리뷰] Advances in All-Neural Speech Recognition

Geoffrey Zweig, Chengzhu Yu|arXiv (Cornell University)|2016. 09. 19.
Speech Recognition and Synthesis참고 문헌 21인용 수 7
한 줄 요약

이 논문은 어휘의 첫 글자를 대문자로 표기하는 새로운 기호 인벤토리와 두 단계 반복 CTC 프레임워크를 도입하여 전면 신경망 음성 인식 기술을 발전시켰다. 이 프레임워크는 두 번째 RNN을 통해 노이즈가 있는 문자 출력을 정제함으로써 잡음이 많은 출력을 개선한다. 이 방법은 외부 언어 모델 없이도 CallHome에서 14.0%의 WER, Switchboard에서 25.3%의 WER를 기록하여, 이전의 엔드 투 엔드 시스템보다 훨씬 뛰어난 성능을 보였으며, 단지 300시간의 Switchboard 데이터만을 사용하였다.

ABSTRACT

This paper advances the design of CTC-based all-neural (or end-to-end) speech recognizers. We propose a novel symbol inventory, and a novel iterated-CTC method in which a second system is used to transform a noisy initial output into a cleaner version. We present a number of stabilization and initialization methods we have found useful in training these networks. We evaluate our system on the commonly used NIST 2000 conversational telephony test set, and significantly exceed the previously published performance of similar systems, both with and without the use of an external language model and decoding technology.

연구 동기 및 목표

  • 외부 언어 모델과 디코딩 컴포넌트에 의존하지 않고 엔드 투 엔드 음성 인식 성능을 향상시키는 것.
  • 신경망만으로 비트 서치 디코더의 논리와 언어 모델링을 모델링할 수 있는지 조사하는 것.
  • CTC 기반 전면 신경망 시스템의 기호 인벤토리 설계 및 훈련 안정화 기법을 탐색하는 것.
  • 두 단계 CTC 프로세스가 원시 신경망 출력을 정제하는 데 효과적인지 평가하는 것.

제안 방법

  • 음성 특징을 직접 그래피엠 출력으로 매핑하기 위해 CTC 프레임워크 하에 양방향 아키텍처를 가진 ReLU-RNN을 사용한다.
  • 공백 기호 대신 단어의 첫 글자를 대문자로 표기하는 새로운 기호 인벤토리를 도입하여 인식 정확도를 향상시킨다.
  • 반복 CTC 접근법을 적용한다: 첫 번째 RNN이 음성에서 문자로 매핑하고, 두 번째 RNN이 노이즈가 있는 문자 시퀀스를 더 깔끔한 출력으로 정제한다.
  • 훈련 안정성을 향상시키기 위해 가중치 정규화 및 신중한 학습률 스케줄링을 포함한 안정화 및 초기화 기법을 적용한다.
  • 최종 WER에 미치는 영향을 평가하기 위해 문자 및 단어 n-gram 언어 모델을 후처리 보완 수단으로 사용한다.
  • 비교를 위해 비트 서치 및 CTC 디코딩을 사용하지만, 외부 언어 모델 없이 완전히 신경망 기반의 후처리에 집중한다.

실험 결과

연구 질문

  • RQ1두 단계 CTC 시스템이 전면 신경망 음성 인식에서 단일 단계 엔드 투 엔드 모델보다 우수한 성능을 낼 수 있는가?
  • RQ2명시적인 빈 칸 기호 대신 단어의 첫 글자를 대문자로 사용하는 기호 인코딩 전략이 성능 향상에 기여하는가?
  • RQ3외부 언어 모델 없이도 신경망이 비트 서치 디코더의 논리만으로 충분히 잘 모델링할 수 있는가?
  • RQ4훈련 안정화 및 초기화 기법이 CTC 기반 RNN의 수렴과 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • 단어의 첫 글자를 대문자로 표기하는 새로운 기호 인벤토리 도입으로 CallHome에서 1.2% 향상되고 Switchboard에서도 1.2% 향상되었다.
  • 반복 CTC 시스템은 CallHome에서 24.7%의 WER, Switchboard에서 37.1%의 WER를 기록하여, 기준 모델보다 각각 1.2%와 1.7% 향상되었다 (언어 모델 없이).
  • 단어 기반 언어 모델을 사용할 경우, CallHome에서 14.0%의 WER, Switchboard에서 25.3%의 WER를 기록하여, NIST 2000 테스트 세트에서 전면 신경망 시스템의 새로운 최신 기술 수준을 수립하였다.
  • LSTM 대신 ReLU-RNN을 사용함으로써 훈련 속도가 향상되었고 정확도는 유지되거나 향상되었으며, 이는 이 맥락에서 ReLU의 효과성을 입증하였다.
  • 문자나 단어 N-gram을 추가하면 반복 CTC의 효과가 감소함을 확인하여, 두 번째 단계 RNN이 이미 언어 모델링 기능의 대부분을 이미 흡수하고 있음을 시사한다.
  • 9층, 1024개의 뉘앙스를 가진 양방향 ReLU-RNN은 5300만 개의 파라미터를 가지며 뛰어난 성능을 보였으며, 이는 깊은 네트워크가 전면 신경망 ASR에서 유효함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.