[논문 리뷰] Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability
이 논문은 최적화된 훈련, 향상된 초기화, 향후 볼록한 전망을 통한 고급 모델링을 통해 최첨단 하이브리드 음성인식 시스템을 뛰어넘는 고정확도 RNN-T 모델을 제시한다. 텍스트 전용 데이터를 활용해 TTS로 생성된 음성으로 예측 및 결합 네트워크만 미세조정함으로써, 런타임 추론 오버헤드 없이 상대적 WER 감소를 달성하였으며, 언어모델 재정렬 및 철자 교정 방법을 능가한다.
Because of its streaming nature, recurrent neural network transducer (RNN-T) is a very promising end-to-end (E2E) model that may replace the popular hybrid model for automatic speech recognition. In this paper, we describe our recent development of RNN-T models with reduced GPU memory consumption during training, better initialization strategy, and advanced encoder modeling with future lookahead. When trained with Microsoft's 65 thousand hours of anonymized training data, the developed RNN-T model surpasses a very well trained hybrid model with both better recognition accuracy and lower latency. We further study how to customize RNN-T models to a new domain, which is important for deploying E2E models to practical scenarios. By comparing several methods leveraging text-only data in the new domain, we found that updating RNN-T's prediction and joint networks using text-to-speech generated from domain-specific text is the most effective.
연구 동기 및 목표
- 3단계 최적화 및 고급 음향 모델링을 통해 훈련된 고정확도 하이브리드 ASR 시스템을 뛰어넘는 RNN-T 모델을 개발한다.
- 최적화된 워드피ece 토큰화 및 메모리 구성으로 RNN-T 훈련 중 GPU 메모리 소비를 줄인다.
- 에코더에서 교차엔트로피 초기화 및 향후 컨텍스트 모델링을 통해 RNN-T 인식 정확도를 향상시킨다.
- 음성 전사 데이터가 필요 없이 도메인 전용 텍스트 데이터만을 사용하여 RNN-T 모델을 맞춤화하는 효과적인 방법을 탐색한다.
- 엔드 투 엔드 ASR에서 도메인 적응을 위한 TTS 기반 적응, 철자 교정, 언어모델 재정렬, 데이터 혼합 방법의 효과를 비교한다.
제안 방법
- 공백 토큰을 언더스코어 표시로 대체하여 GPU 메모리 사용량을 줄였고, 이로 인해 워드피ece 유닛(WPU) 분해 횟수를 약 50% 감소시켰다.
- 시간에 맞춰 정렬된 음성 특징과 WPU 전사 정보를 사용해 교차엔트로피(CE) 훈련을 통해 RNN-T 에코더를 초기화함으로써 훈련 안정성과 정확도를 향상시켰다.
- 에코더에 2프레임의 향후 볼록한 전망을 도입하여 컨텍스트 인식 표현을 가능하게 하여 전달 과정의 성능을 향상시켰다.
- 도메인 전용 텍스트에서 합성 TTS 음성을 생성하고, 예측 및 결합 네트워크만을 미세조정하여 RNN-T 모델을 도메인에 맞게 맞춤화했다.
- 기타 적응 방법을 평가: LSTM-LM를 사용한 언어모델 재정렬, 트랜스포머 기반 모델을 사용한 철자 교정, 실제 음성 데이터와 TTS 데이터 혼합.
- 더 나은 철자 교정 성능을 위해 사전 학습된 RoBERTa를 사용하여 비사전 학습 버전보다 더 큰 WER 감소를 달성했다.
실험 결과
연구 질문
- RQ1최적화된 초기화 및 향후 컨텍스트 모델링을 적용한 RNN-T 모델이 정확도와 지연 시간 모두에서 고성능 하이브리드 ASR 시스템을 뛰어넘을 수 있는가?
- RQ2음성 전사 데이터가 없을 때 도메인 전용 텍스트 데이터만 존재하는 상황에서 TTS 기반 데이터 증강이 RNN-T 모델 적응에 얼마나 효과적인가?
- RQ3실제 음성 데이터가 필요 없이 TTS로 생성된 음성을 사용해 예측 및 결합 네트리지만 미세조정하는 방법이 언어모델 재정렬이나 철자 교정과 같은 추가 추론 단계가 필요한 방법보다 우월한가?
- RQ4저자원 도메인 환경에서 실제 음성 데이터와 TTS로 생성된 데이터를 혼합하는 것이 모델 적응에 미치는 영향은 무엇인가?
- RQ5대규모 텍스트 데이터(예: RoBERTa)에서 사전 학습한 모델이 RNN-T 적응을 위한 철자 교정 모델의 성능을 어떻게 향상시키는가?
주요 결과
- CE 초기화와 2프레임의 향후 볼록 전망을 적용한 RNN-T 모델은 기준 모델 대비 11.6% 상대적 WER 감소를 달성했으며, 최고의 하이브리드 모델을 3.1% 상대적 WER 감소로 뛰어넘었다.
- 최종 RNN-T 모델은 최고의 하이브리드 모델보다 에코더의 향후 볼록 지연 시간이 120ms 낮아져 스트리밍 효율성이 향상됨을 입증했다.
- 도메인 전용 텍스트에서 생성한 TTS 음성을 사용해 예측 및 결합 네트워크만을 미세조정함으로써, 1280p640x6, 1600p800_4x6, 2560p800_4x6 모델 각각에 대해 7.9%, 7.2%, 9.8% 상대적 WER 감소를 달성했다.
- 실제 음성 데이터와 TTS 데이터를 혼합한 방법보다 TTS 전용 적응 방법이 더 우수했으며, 이는 충분한 텍스트 데이터만으로도 추가 실음성 데이터 없이 효과적으로 모델을 적응시킬 수 있음을 시사한다.
- 도메인 텍스트에서 사전 학습된 RoBERTa를 사용한 철자 교정은 1280p640x6 및 1600p800_4x6 모델에서 각각 7.9% 및 6.1% 상대적 WER 감소를 달성했으며, 비사전 학습 버전을 능가했다.
- 도메인 전용 LSTM-LM를 사용한 언어모델 재정렬은 각각 3.9% 및 1.6% 상대적 WER 감소를 이뤘지만, 추가 런타임 계산이 필요했고, TTS 기반 적응과는 달리 파rameter 효율성이 떨어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.