Skip to main content
QUICK REVIEW

[논문 리뷰] Improving RNN transducer with normalized jointer network

Mingkun Huang, Jun Zhang|arXiv (Cornell University)|2020. 11. 03.
Speech Recognition and Synthesis참고 문헌 26인용 수 5
한 줄 요약

이 논문은 RNN-T 학습 중 큰 기울기 분산 문제를 해결하기 위해 정규화된 조인터 네트워크를 제안하며, 수렴성과 성능을 크게 향상시킨다. 인코더와 프레디кт로에 각각 T와 U 요소를 적용한 기울기 정규화를 통해 역전파를 안정화시키고, 마스크된 Conformer 인코더와 Transformer-XL 프레디кт로를 통합함으로써, 외부 언어 모델 없이도 AISHELL-1에서 SOTA 성능(5.37% CER)을 달성하고, 30,000시간 규모의 산업용 데이터셋에서 상용 하이브리드 시스템 대비 9% 상대적 향상도 달성한다.

ABSTRACT

Recurrent neural transducer (RNN-T) is a promising end-to-end (E2E) model in automatic speech recognition (ASR). It has shown superior performance compared to traditional hybrid ASR systems. However, training RNN-T from scratch is still challenging. We observe a huge gradient variance during RNN-T training and suspect it hurts the performance. In this work, we analyze the cause of the huge gradient variance in RNN-T training and proposed a new extit{normalized jointer network} to overcome it. We also propose to enhance the RNN-T network with a modified conformer encoder network and transformer-XL predictor networks to achieve the best performance. Experiments are conducted on the open 170-hour AISHELL-1 and industrial-level 30000-hour mandarin speech dataset. On the AISHELL-1 dataset, our RNN-T system gets state-of-the-art results on AISHELL-1's streaming and non-streaming benchmark with CER 6.15\% and 5.37\% respectively. We further compare our RNN-T system with our well trained commercial hybrid system on 30000-hour-industry audio data and get 9\% relative improvement without pre-training or external language model.

연구 동기 및 목표

  • RNN-T 학습 중 큰 기울기 분산 문제를 해결함으로써 수렴성과 성능 향상을 저해하는 요인을 제거한다.
  • 사전 학습 없이도 RNN-T 성능을 향상시키는 방법을 개선한다.
  • 마스크된 Conformer와 Transformer-XL과 같은 고급 아키텍처가 엔드 투 엔드 음성 인식에서 RNN-T에 어떻게 기여하는지 탐색한다.
  • 오픈소스(AISHELL-1) 및 산업 규모(30,000시간)의 중국어 ASR 벤치마크에서 모두 최고 성능을 달성한다.

제안 방법

  • 조인터에서 인코더와 프레디кт로로의 역전파를 안정화시키기 위해 T(음성 길이)와 U(문자열 길이) 요소를 적용한 기울기 정규화를 수행하는 정규화된 조인터 네트워크를 제안한다.
  • 인코더의 국소적 컨텍스트 모델링을 향상시키기 위해 40개의 왼쪽 및 오른쪽 컨텍스트 마스크를 적용한 마스크된 Conformer 인코더를 도입한다.
  • 상대적 위치 인코딩과 장거리 의존성 모델링을 통해 자동회귀 언어 모델링 성능을 향상시키기 위해 Transformer-XL 프레디кт로 네트워크를 사용한다.
  • Adam 옵timizer를 사용하여 선형 웜업과 지수 감소 학습률 스케줄을 적용해 RNN-T 시스템을 엔드 투 엔드로 학습시킨다.
  • 데이터 증강을 위해 SpecAugment를 적용하고, 모든 구성 요소에 드롭아웃(0.1)을 사용해 정규화를 수행한다.
  • 후보 확률 추정을 위해 768차원 투영과 소프트맥스 출력을 사용해 조인터 네트워크를 최적화한다.

실험 결과

연구 질문

  • RQ1RNN-T 학습 중 큰 기울기 분산은 무엇을 원인으로 하고 있으며, 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ2조인터 레이어에서의 기울기 정규화가 분산을 완화하고 학습 안정성을 향상시킬 수 있는가?
  • RQ3마스크된 Conformer와 Transformer-XL 구성 요소가 사전 학습 없이 RNN-T 성능을 어떻게 향상시키는가?
  • RQ4엔드 투 엔드 RNN-T 시스템이 대규모 산업 데이터에서 잘 최적화된 상용 하이브리드 시스템을 능가할 수 있는가?

주요 결과

  • 제안된 정규화된 조인터 네트워크는 기울기 분산을 줄여 더 빠르고 안정적인 학습을 가능하게 하였으며, 개선된 검증 손실 곡선을 통해 이를 입증하였다.
  • AISHELL-1 데이터셋에서 최종 RNN-T 시스템은 스트리밍 모드에서 6.15% CER, 비스트리밍 모드에서 5.37% CER를 달성하여 이전 SOTA 결과를 초월하였다.
  • 110M 파rameter를 가진 스트리밍 라지 모델은 외부 언어 모델 없이도 비스트리밍 AISHELL-1에서 5.37% CER를 달성하여 SOTA 성능을 입증하였다.
  • 30,000시간 규모의 산업용 중국어 데이터셋에서 RNN-T 시스템은 잘 최적화된 하이브리드 시스템 대비 9% 상대적 향상도를 기록하였으며, 근거리 테스트 세트에서는 6.14% CER, 원거리 테스트 세트에서는 12.70% CER를 기록하였다.
  • 스트리밍 베이스 모델(46M 파라미터)은 상당히 작은 모델 크기로도 근거리 테스트 세트에서 6.80% CER를 달성하여 110M 파라미터의 하이브리드 시스템과 유사한 성능을 보였다.
  • LSTM 프레디кт로를 Transformer-XL로 교체함으로써 CER가 6.35%에서 6.18%로 감소하여 고급 자동회귀 모델링의 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.