[논문 리뷰] Improving RNN Transducer Modeling for End-to-End Speech Recognition
이 논문은 훈련 메모리 사용을 최적화하여 더 큰 미니배치 크기를 허용하고, 새로운 모델 아키텍처를 제안함으로써 엔드 투 엔드 음성 인식을 위한 RNN Transducer(RNN-T) 모델링을 향상시켰다. 특히 인코더에선 향상된 컨텍스트 장기 기억(long short-term memory) 게이팅 순환 단위(ecltGRU)를, 예측 네트워크에선 GRU를 사용하였다. 최고의 모델은 기준 RNN-T보다 크기가 작지만 11.8% 상대적 WER 감소를 달성하였으며, 유사 크기의 장치 하이브리드 모델보다 15.0% 상대적 WER 감소를 기록했고, 5.1GB 크기의 서버 하이브리드 모델과도 동등한 WER 성능을 보였다.
In the last few years, an emerging trend in automatic speech recognition research is the study of end-to-end (E2E) systems. Connectionist Temporal Classification (CTC), Attention Encoder-Decoder (AED), and RNN Transducer (RNN-T) are the most popular three methods. Among these three methods, RNN-T has the advantages to do online streaming which is challenging to AED and it doesn't have CTC's frame-independence assumption. In this paper, we improve the RNN-T training in two aspects. First, we optimize the training algorithm of RNN-T to reduce the memory consumption so that we can have larger training minibatch for faster training speed. Second, we propose better model structures so that we obtain RNN-T models with the very good accuracy but small footprint. Trained with 30 thousand hours anonymized and transcribed Microsoft production data, the best RNN-T model with even smaller model size (216 Megabytes) achieves up-to 11.8% relative word error rate (WER) reduction from the baseline RNN-T model. This best RNN-T model is significantly better than the device hybrid model with similar size by achieving up-to 15.0% relative WER reduction, and obtains similar WERs as the server hybrid model of 5120 Megabytes in size.
연구 동기 및 목표
- RNN-T 훈련 중 메모리 소비를 줄여 더 큰 미니배치 크기와 더 빠른 훈련을 가능하게 하기 위해.
- 기본 LSTM 기반 RNN-T보다 더 정확하고 컴act한 RNN-T 모델 아키텍처를 설계하기 위해.
- 자원 제약이 있는 장치에 배포 가능한 고정밀도, 저자원 소비 RNN-T 모델을 가능하게 하기 위해.
- 미래 컨텍스트 라운드어라운드와 레이어 트랙토리 설계가 RNN-T 성능에 미치는 영향을 조사하기 위해.
제안 방법
- 큰 중간 텐서를 저장하지 않도록 기울기 계산을 재구성하여, RNN-T 역전파 중 메모리 사용을 크게 감소시켰다.
- ecltGRU 아키텍처를 제안하였으며, 깊이 및 시간 기반 LSTM/GRU 유닛을 사용해 시간적 모델링과 분류 작업을 분리하였다.
- 레이어 트랙토리 개념을 도입하여 분류 작업을 시간적 모델링에서 분리함으로써 표현 효율성을 향상시켰다.
- 인코더와 예측 네트워크 출력을 결합하기 위해 학습 가능한 투영 행렬 U, V와 비선형 활성화 함수 ψ를 사용한 조인 네트워크를 적용하였다.
- 추론 비용을 줄이기 위해 2배의 프레임 스킵을 적용하여 입력 프레임을 20ms로 축소하였다.
- 빔 서치 디코딩(빔 폭 10)을 사용하여 30,000시간의 익명화된 마이크로소프트 생산 데이터를 기반으로 모델을 훈련시켰다.
실험 결과
연구 질문
- RQ1메모리 최적화된 RNN-T 훈련이 더 큰 미니배치 크기와 더 빠른 수렴을 가능하게 하는가?
- RQ2기본 LSTM 유닛을 ecltGRU와 같은 새로운 아키텍처로 대체하면 RNN-T 정확도와 모델 효율성이 향상되는가?
- RQ3인코더에서 미래 컨텍스트 라운드어라운드가 정렬 지연을 얼마나 줄이고 인식 성능을 향상시키는가?
- RQ4유사한 크기의 하이브리드 모델과 비교했을 때 제안된 RNN-T 모델은 정확도와 크기 측면에서 어떤가?
주요 결과
- ecltGRU를 인코더에, GRU를 예측 네트워크에 사용한 최고의 RNN-T 모델은 기준 LSTM 기반 RNN-T 모델 대비 11.8% 상대적 단어 오류율(WER) 감소를 달성하였다.
- 이 최고의 모델은 크기가 216MB에 불과했으며, 기준 RNN-T 모델보다 작았지만, 유사 크기의 장치 하이브리드 모델보다 15.0% 상대적 WER 감소를 기록했다.
- 이 모델은 훨씬 더 작은 포트폴리오를 지녔음에도 불구하고, 5.12GB 언어 모델을 갖춘 대규모 서버 하이브리드 모델과 동등한 WER 성능을 보였다.
- ecltGRU 인코더는 평균 정렬 지연을 10개 입력 프레임(300ms)에서 2개 입력 프레임(60ms)으로 줄여, 24프레임의 미래 컨텍스트 라운드어라운드를 통해 조기 결정 능력을 향상시켰다.
- 메모리 최적화 덕분에 더 큰 미니배치 크기를 허용하여, 모델 품질에 손상 없이 훈련 속도를 높일 수 있었다.
- 레이어 트랙토리와 ecltGRU 내부의 별도의 깊이/시간 유닛 사용 덕분에 표준 LSTM보다 더 높은 정확도와 더 작은 모델 크기를 달성할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.