Skip to main content
QUICK REVIEW

[논문 리뷰] On Language Model Integration for RNN Transducer based Speech Recognition

Wei Zhou, Zuoyun Zheng|arXiv (Cornell University)|2021. 10. 13.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 RNN-Transducer 기반 음성 인식에서 모델 내부 언어 모델(ILM)과 외부 언어 모델(LM) 간의 불일치를 보정함으로써 언어 모델(LM) 통합을 향상시키는 새로운 정확한 ILM 훈련 프레임워크를 제안한다. HAT 증명을 확장하고 통합된 RNN-T 프레임워크 내에서 ILM 보정을 정식화함으로써, 도메인 내(Librispeech) 및 도메인 간(TED-LIUM) 벤치마크에서 최신 기술 수준의 WER 향상을 달성하였으며, 특히 미니-LSTM 기반 ILM 방법과 정확한 ILM 훈련을 조합할 경우 최고의 성능을 기록하였다.

ABSTRACT

The mismatch between an external language model (LM) and the implicitly learned internal LM (ILM) of RNN-Transducer (RNN-T) can limit the performance of LM integration such as simple shallow fusion. A Bayesian interpretation suggests to remove this sequence prior as ILM correction. In this work, we study various ILM correction-based LM integration methods formulated in a common RNN-T framework. We provide a decoding interpretation on two major reasons for performance improvement with ILM correction, which is further experimentally verified with detailed analysis. We also propose an exact-ILM training framework by extending the proof given in the hybrid autoregressive transducer, which enables a theoretical justification for other ILM approaches. Systematic comparison is conducted for both in-domain and cross-domain evaluation on the Librispeech and TED-LIUM Release 2 corpora, respectively. Our proposed exact-ILM training can further improve the best ILM method.

연구 동기 및 목표

  • 모델의 내부 언어 모델(ILM)과 외부 언어 모델(LMs) 간의 불일치로 인한 RNN-Transducer 기반 음성 인식의 성능 제한을 해결하기 위함.
  • RNN-T 아키텍처 내에서 다양한 ILM 보정 기반 LM 통합 방법을 비교하기 위한 통합 프레임워크 제공.
  • HAT 증명을 확장하여 정확한 ILM 훈련 목표를 유도함으로써 ILM 보정 방법의 이론적 근거를 제시하기 위함.
  • 도메인 내(Librispeech) 및 도메인 간(TED-LIUM Release 2) 음성 인식 작업에서 제안된 방법을 체계적으로 평가하기 위함.

제안 방법

  • 하이브리드 자동회귀 변환기(HAT) 프레임워크의 이론적 증명을 확장하여, 새로운 정확한 ILM 훈련 목표 $\mathcal{L}^{\text{exact}}_{\text{ILM}}$ 를 제안한다.
  • 다양한 ILM 보정 방법(밀도 비율, HAT 방식, 미니-LSTM 기반)의 공식화와 비교를 가능하게 하는 통합된 RNN-T 프레임워크를 도입한다.
  • 베이지안 디코딩 해석을 적용하여 ILM 보정의 두 가지 주요 이점을 설명한다: 레이블 확률 분포 재균형화와 레이블 가능도 증가.
  • 재정규화와 길이 보상 기반 수정된 디코딩 전략을 사용하여 ILM 보정 구성 요소의 개별 효과를 분리하고 검증한다.
  • 인코더, 예측, 조인트 네트워크로 구성된 RNN-T 아키텍처를 사용하며, ILM 은 인코더 영향을 제외한 모델 내부 동역학에서 추정된다.
  • 외부 LM 점수와 함께 로그선형 조합(얕은 융합)을 적용하지만, RNN-T 후행 확률를 추정된 ILM으로 보정하여 불일치를 감소시킨다.

실험 결과

연구 질문

  • RQ1디코딩 관점에서 ILM 보정은 RNN-Transducer 기반 음성 인식에서 성능을 어떻게 향상시키는가?
  • RQ2ILM 보정이 인식 정확도를 향상시키는 두 가지 주요 메커니즘은 무엇이며, 실험적으로 어떻게 분리하고 검증할 수 있는가?
  • RQ3ILM 보정의 이론적 근거는 근사치를 넘어서 정확한 훈련 목표로 확장될 수 있는가?
  • RQ4제안된 정확한 ILM 훈련 프레임워크는 도메인 내 및 도메인 간 음성 인식 작업에서 기존의 ILM 보정 방법과 비교해 성능가능성이 어떻게 되는가?
  • RQ5ILM의 공동 훈련이 $\mathcal{L}_{\text{ILMT}}$ 를 통해 다양한 ILM 보정 방법에서 성능 향상에 기여하는가?

주요 결과

  • 제안된 정확한 ILM 훈련 프레임워크 ($\mathcal{L}^{\text{exact}}_{\text{ILM}}$) 는 모든 평가 설정에서 최고의 성능을 기록하였으며, Librispeech 및 TED-LIUM Release 2 데이터셋에서 모든 다른 ILM 보정 방법을 능가하였다.
  • 원래 주로 어텐션 모델에 사용된 $h'_{\text{mini-LSTM}}$ ILM 방법은 RNN-T에 적용했을 때 ILM 보정 접근법 중에서 가장 우수한 성능을 보였으며, 특히 정확한 ILM 훈련과 조합했을 경우 두드러진 성능 향상을 보였다.
  • 도메인 내 Librispeech dev-other 셋에서, $h'_{\text{mini-LSTM}}$ 방법과 정확한 ILM 훈련을 조합하면 WER가 4.4%로 향상되었으며, 베이스라인 SF(5.1%) 및 기타 ILM 방법보다 뚜렷한 개선을 보였다.
  • 도메인 간 TED-LIUM Release 2 셋에서는 동일한 방법이 WER를 10.5%로 낮춰 도메인 이동에 대한 강건성을 입증하였다.
  • 분석적 아블레이션 연구는 ILM 보정이 두 가지 별개의 이점을 제공함을 확인하였다: 레이블 확률 분포 재균형화와 레이블 가능도 증가로, 이 두 가지는 상호 보완적이고 상호 강화 작용을 한다.
  • $\mathcal{L}_{\text{ILMT}}$ 훈련 목표는 도메인 간 TLv2 작업에서 성능 향상을 보였지만, 도메인 내 Librispeech 작업에서는 효과가 없었으며, 이는 HAT에서 이전에 관찰된 바와 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.