[논문 리뷰] On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition
이 논문은 익명화된 마이크로소프트 음성 데이터 65,000시간을 대상으로 RNN-T, RNN-AED, Transformer-AED 모델 간의 대규모 실험적 비교를 수행하며, 스트리밍 및 비스트리밍 추론 모두를 평가한다. 결과적으로 Transformer-AED는 두 모드 모두에서 가장 높은 정확도를 달성하였고, CE 초기화 및 컨텍스트 모델링 기법이 RNN-T 성능을 크게 향상시켜 고도로 최적화된 하이브리드 모델을 뛰어넘을 수 있도록 하였다.
Recently, there has been a strong push to transition from hybrid models to end-to-end (E2E) models for automatic speech recognition. Currently, there are three promising E2E methods: recurrent neural network transducer (RNN-T), RNN attention-based encoder-decoder (AED), and Transformer-AED. In this study, we conduct an empirical comparison of RNN-T, RNN-AED, and Transformer-AED models, in both non-streaming and streaming modes. We use 65 thousand hours of Microsoft anonymized training data to train these models. As E2E models are more data hungry, it is better to compare their effectiveness with large amount of training data. To the best of our knowledge, no such comprehensive study has been conducted yet. We show that although AED models are stronger than RNN-T in the non-streaming mode, RNN-T is very competitive in streaming mode if its encoder can be properly initialized. Among all three E2E models, transformer-AED achieved the best accuracy in both streaming and non-streaming mode. We show that both streaming RNN-T and transformer-AED models can obtain better accuracy than a highly-optimized hybrid model.
연구 동기 및 목표
- 실제 산업 환경에서 가장 주목받는 엔드 투 엔드 ASR 모델인 RNN-T, RNN-AED, Transformer-AED를 대규모로 종합적으로 실험적으로 비교하기 위해.
- 엄청난 65,000시간 분량의 데이터를 사용하여 스트리밍 및 비스트리밍 추론 모드에서의 모델 성능을 평가하기 위해.
- RNN-T 및 Transformer-AED 성능에 영향을 주는 인코더 초기화 방식(CE 대비 CTC)과 향후 컨텍스트 모델링의 영향을 조사하기 위해.
- 단일 스트리밍 E2E 모델이 고도로 최적화된 하이브리드 ASR 시스템을 초월할 수 있는지 확인하기 위해.
- 미래 연구를 지원하기 위해 Transformer-AED에 대한 재현 가능한 코드를 공개하기 위해.
제안 방법
- 공통된 인코더 아키텍처를 사용하여 익명화된 마이크로소프트 음성 데이터 65,000시간을 기반으로 RNN-T, RNN-AED, Transformer-AED 모델을 훈련시켰다. 이는 공정한 비교를 위해 필수적이다.
- 모든 인코더 블록에 균등하게 배분된 향후 프레임을 활용하는 다층 컨텍스트 모델링 기법을 제안하여 향후 컨텍스트 활용도를 향상시켰다.
- RNN-T 인코더에 대해 교차 엔트로피(CE) 초기화 방법을 도입하여 정렬 학습을 향상시키고, 무작위 초기화 대비 WER을 8.0% 상대적으로 감소시켰다.
- 스트리밍 Transformer-AED에 대한 두 가지 향후 컨텍스트 전략을 구현: 블록 단위로 향후 컨텍스트를 할당하는 룩어헤드 방식과 고정 크기의 향후 컨텍스트 창을 사용하는 청크 기반 방식.
- 메모리 용량을 늘리면서도 모델 크기를 유지하기 위해 내부 프로젝션과 레이어 정규화를 적용한 맞춤형 LSTM 유닛을 사용하였다.
- 음소 정렬 정보가 확보되지 않은 경우, 단어피ece 길이 분할 기법을 적용하여 CE 미사전학습을 위한 시간 정렬을 근사하였다.
실험 결과
연구 질문
- RQ1대규모 데이터셋에서 스트리밍 및 비스트리밍 추론 모드에서 RNN-T, RNN-AED, Transformer-AED의 WER 성능는 어떻게 비교되는가?
- RQ2특히 스트리밍 환경에서 CE 초기화와 CTC 초기화의 RNN-T 모델 성능에 미치는 영향은 어떠한가?
- RQ3스트리밍 Transformer-AED 모델에서 룩어헤드 방식과 청크 기반 방식 중 어느 것이 더 높은 성능을 내는가?
- RQ4단일 스트리밍 E2E 모델이 정확도 측면에서 고도로 최적화된 하이브리드 ASR 시스템을 뛰어넘을 수 있는가?
- RQ5다층 컨텍스트 모델링은 단일 레이어 룩어헤드 또는 컨볼루션 기반 룩어헤드 대비 WER 향상에 얼마나 기여하는가?
주요 결과
- Transformer-AED는 스트리밍 모드에서 WER 9.16%를 기록하여 모든 테스트 세트에서 RNN-T 및 RNN-AED를 모두 압도하였다.
- CE 초기화 및 다층 컨텍스트 모델링를 적용한 RNN-T는 WER 9.27%를 달성하여 표준 RNN-T 모델을 크게 뛰어넘었고, 최고의 RNN-AED 모델마저도 뛰어넘었다.
- Transformer-AED의 청크 기반 향후 컨텍스트 통합 방식은 룩어헤드 방식 대비 WER을 10.7% 상대적으로 감소시켜 향후 컨텍스트를 더 효과적으로 활용함을 입증하였다.
- CE 초기화 방법은 RNN-T의 WER을 무작위 초기화 대비 8.0% 상대적으로 감소시켰으며, 이는 대규모 환경에서도 정렬 인식 목표를 가진 미사전학습이 매우 유익하다는 것을 시사한다.
- 스트리밍 RNN-T(9.27%)와 Transformer-AED(9.16%) 모두 고도로 최적화된 하이브리드 모델보다 더 높은 정확도를 달성하여 현대형 E2E 접근 방식의 우수성을 입증하였다.
- 제안된 다층 컨텍스트 모델링 기법은 모든 인코더 블록에 걸쳐 룩어헤드 프레임을 더 효과적으로 할당함으로써, 룩어헤드 컨볼루션 방식보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.