Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring RNN-Transducer for Chinese Speech Recognition

Senmao Wang, Pan Zhou|arXiv (Cornell University)|2018. 11. 13.
Speech Recognition and Synthesis참고 문헌 16인용 수 6
한 줄 요약

이 논문은 중국어 대규모 연속 음성 인식(LVCSR)에서 RNN-Transducer(RNN-T)의 훈련 절차를 단순화하는 방법을 제안한다. 사전 훈련을 제거하기 위해 컨볼루션 계층을 통합하고 학습률 감쇠 및 서브샘플링을 최적화하였다. 1,000시간 분량의 코퍼스에서 16.9%의 문자 오류률(CER)을 달성하였으며, 강력한 BLSTM CE 기반 시스템 대비 2% 절대적 향상률을 보였다. 이는 아키텍처의 복잡도를 최소화하면서도 엔드 투 엔드 RNN-T가 전통적 시스템을 능가할 수 있음을 보여준다.

ABSTRACT

End-to-end approaches have drawn much attention recently for significantly simplifying the construction of an automatic speech recognition (ASR) system. RNN transducer (RNN-T) is one of the popular end-to-end methods. Previous studies have shown that RNN-T is difficult to train and a very complex training process is needed for a reasonable performance. In this paper, we explore RNN-T for a Chinese large vocabulary continuous speech recognition (LVCSR) task and aim to simplify the training process while maintaining performance. First, a new strategy of learning rate decay is proposed to accelerate the model convergence. Second, we find that adding convolutional layers at the beginning of the network and using ordered data can discard the pre-training process of the encoder without loss of performance. Besides, we design experiments to find a balance among the usage of GPU memory, training circle and model performance. Finally, we achieve 16.9% character error rate (CER) on our test set which is 2% absolute improvement from a strong BLSTM CE system with language model trained on the same text corpus.

연구 동기 및 목표

  • 중국어 LVCSR에서 RNN-Transducer를 위한 일반적으로 복잡하고 다단계로 이루어진 훈련 파이프라인을 단순화하기 위해.
  • CTC 모델을 통한 사전 훈련이 필요 없도록 컨볼루션 계층과 대체 초기화 전략을 도입함으로써 이를 제거하기 위해.
  • 학습률 감쇠, 서브샘플링, 배치 크기 관리 등을 통해 훈련 효율을 최적화하기 위해.
  • 언어 모델 초기화 및 서브샘플링이 모델 성능과 GPU 메모리 사용에 미치는 영향을 평가하기 위해.

제안 방법

  • 손실이 증가하기 시작한 이후 매 에포크마다 학습률을 반으로 줄이는 날카운 감쇠 전략을 제안하여 수렴 속도를 가속화한다.
  • CTC 모델을 통한 사전 훈련이 필요 없도록 BLSTM 인코더 이전에 컨볼루션 계층을 도입한다.
  • 최대 풀링과 피라미드 BLSTM 계층을 통해 서브샘플링을 구현하여 GPU 메모리 사용량을 줄이고 훈련 속도를 향상시킨다.
  • 문자 수준의 LSTM 언어 모델을 전사 데이터로 훈련시켜 예측 네트워크를 초기화함으로써 성능 향상을 도모한다.
  • 속도, 메모리, 정확도의 균형을 맞추기 위해 다양한 서브샘플링 설정(위치 및 비율)을 비교한다.
  • 모든 최적화 전략을 하나의 RNN-T 모델에 통합하여 사전 훈련 없이 완전히 새롭게 훈련시킨다.

실험 결과

연구 질문

  • RQ1CTC 모델을 통한 사전 훈련 단계를 제거함으로써 RNN-T 훈련 과정을 단순화할 수 있는가?
  • RQ2BLSTM 인코더 이전에 컨볼루션 계층을 추가하면 성능과 훈련 복잡도에 어떤 영향을 미치는가?
  • RQ3중국어 음성 인식을 위한 RNN-T 훈련에서 수렴을 가장 효과적으로 가속화하는 학습률 감쇠 전략은 무엇인가?
  • RQ4서브샘플링은 GPU 메모리 사용량, 훈련 속도, 모델 정확도에 어떤 영향을 미치는가?
  • RQ5외부 데이터가 아닌 동일한 전사 데이터로 훈련된 언어 모델을 사용해 예측 네트워크를 초기화하면 성능 향상이 가능한가?

주요 결과

  • 제안된 학습률 감쇠 전략은 모델 수렴 속도를 크게 가속화하고 훈련 안정성을 향상시킨다.
  • BLSTM 인코더 이전에 컨볼루션 계층을 추가함으로써 CTC 사전 훈련이 필요 없어지면서도 성능에 손실가지 않는다.
  • 피라미드 BLSTM를 통해 총 서브샘플링 비율 4–6을 달성할 경우, 훈련 속도, 메모리 사용량, 정확도 사이의 최적의 균형을 이룬다.
  • 동일한 전사 데이터로 훈련된 언어 모델을 사용해 예측 네트워크를 초기화하면 외부 데이터 기반 초기화보다 더 우수한 성능을 낸다.
  • 최종 RNN-T 모델은 1,000시간 분량의 중국어 코퍼스에서 16.9% CER을 달성하였으며, 언어 모델을 사용한 강력한 BLSTM CE 시스템 대비 2% 절대적 향상률을 보였다.
  • 10,000시간 분량의 코퍼스에서는 외부 언어 모델 없이도 10.52% CER을 달성하였으며, 지연 시간을 통제한 BLSTM 시스템(11.30% CER)을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.