Skip to main content
QUICK REVIEW

[논문 리뷰] LSTM Language Models for LVCSR in First-Pass Decoding and Lattice-Rescoring

Eugen Beck, Wei Zhou|arXiv (Cornell University)|2019. 07. 01.
Speech Recognition and Synthesis참고 문헌 31인용 수 20
한 줄 요약

이 논문은 LVCSR에서 신경망 언어 모델의 정확성을 효율적으로 활용하기 위해 첫 번째 단계 LSTM 언어 모델(LSTM-LM) 디코딩과 레이티스 재평가를 조합한 하이브리드 디코딩 전략을 제안한다. 동일한 마지막 두 단어를 공유하는 가설을 재결합하고, GPGPU 하드웨어에서 결과 레이티스를 재평가함으로써, 실시간 추론 속도(RTF ≈ 1)에서 경쟁적인 WER(11.7% on Hub5'00)를 달성한다. 이는 표준 백오프 언어 모델 디코딩과 레이티스 재평가만을 사용하는 것보다 우수하다.

ABSTRACT

LSTM based language models are an important part of modern LVCSR systems as they significantly improve performance over traditional backoff language models. Incorporating them efficiently into decoding has been notoriously difficult. In this paper we present an approach based on a combination of one-pass decoding and lattice rescoring. We perform decoding with the LSTM-LM in the first pass but recombine hypothesis that share the last two words, afterwards we rescore the resulting lattice. We run our systems on GPGPU equipped machines and are able to produce competitive results on the Hub5'00 and Librispeech evaluation corpora with a runtime better than real-time. In addition we shortly investigate the possibility to carry out the full sum over all state-sequences belonging to a given word-hypothesis during decoding without recombination.

연구 동기 및 목표

  • LSTM-LM를 음성 인식 디코딩에 통합할 경우 발생하는 높은 계산 비용을 해결하기 위해.
  • 기존의 백오프 언어 모델과 비교해 정확도를 유지하거나 향상시키면서 디코딩 효율성을 향상시키기 위해.
  • HMM 상태 시퀀스에 대한 전체 합계 디코딩의 실현 가능성을 탐색하기 위해.
  • 대규모 어휘 작업에서 재결합과 레이티스 재평가를 적용한 첫 번째 단계 LSTM-LM 디코딩의 성능을 평가하기 위해.
  • GPGPU 가속 디코딩을 통해 경쟁적인 WER를 달성하는 실시간 추론을 입증하기 위해.

제안 방법

  • GPGPU에서 첫 번째 단계 디코딩을 수행하며, 검색 공간을 줄이기 위해 마지막 두 단어 기반의 재결합 한도를 적용한다.
  • 같은 3단어 문맥을 공유하는 가설은 레이티스 재평가 이전에 통합하여 계산 부담을 감소시킨다.
  • 결과로 생성된 레이티스는 동일한 LSTM-LM을 사용해 재평가하여 단어 시퀀스 확률을 정밀화한다.
  • 경로 확률 합산을 최대화하는 대신, 수정된 동적 프rogram밍 함수를 사용해 전체 합계 디코딩을 가능하게 한다.
  • 디코더 프레임워크는 트리 조건 기반 검색과 동적 언어 모델 상태 관리를 지원하기 위해 RWTH ASR 툴킷에서 확장된다.
  • 노이즈 대비 추정(NCE)은 향후 대규모 어휘 작업에서 추론 시간을 줄이기 위한 최적화로 고려된다.

실험 결과

연구 질문

  • RQ1최소한의 재결합으로 첫 번째 단계 디코딩에 LSTM-LM을 효과적으로 사용할 수 있을까?
  • RQ2첫 번째 단계 디코딩 이후에 LSTM-LM을 사용해 레이티스를 재평가하면 백오프 언어 모델로만 재평가하는 것보다 더 낮은 WER를 달성할 수 있을까?
  • RQ3HMM 상태 시퀀스에 대해 전체 합계 디코딩을 사용할 경우 Viterbi 디코딩보다 정확도가 향상될 수 있을까?
  • RQ4첫 번째 단계 LSTM 디코딩의 계산 비용은 어휘 크기와 함께 어떻게 증가하는가? 그리고 대규모 어휘 작업에 최적화될 수 있는가?
  • RQ5재결합과 재평가의 조합이 WER과 RTF 측면에서 종단 간 LSTM-LM 디코딩보다 우수한가?

주요 결과

  • 제안된 방법은 Hub5'00 평가 세트에서 RTF 약 1에서 WER 11.7%를 달성하여 실시간 성능과 높은 정확도를 동시에 확보했다.
  • 재결합을 거친 첫 번째 단계 디코딩 후 LSTM-LM을 사용한 레이티스 재평가가 단독으로 백오프 언어 모델로 재평가하는 것보다 더 낮은 WER를 제공한다.
  • 혼동 네트워크 디코딩과 결합했을 때 전체 합계 디코딩은 WER를 11.7%에서 11.4%로 향상시키지만, 검색 공간 크기가 증가한다.
  • Librispeech dev-clean 세트에서 최고 전략(재결합 및 재평가를 포함한 첫 번째 단계 LSTM-LM)은 RTF ≈ 6.95에서 2.39% WER를 달성하여 어휘 크기가 클수록 더 높은 계산 비용을 유발함을 시사한다.
  • Librispeech의 'other' 조건에서의 디코딩은 'clean' 조건보다 훨씬 느리며(RTF 약 4배 높음), 유사한 음성 점수로 인해 발생한다.
  • 표준 백오프 언어 모델 디코딩과 백오프 모델을 사용한 레이티스 재평가를 모두 초월하며, LSTM-LM을 디코딩 파이프라인의 조기에 통합하는 데서 유의미한 이점이 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.