[논문 리뷰] Transfer Learning Approaches for Streaming End-to-End Speech Recognition System
이 논문은 RNN-T 모델을 사용한 스트리밍 엔드 투 엔드 음성 인식에서 저자원 언어인 힌두어(hi-IN)에 대해 전이 학습(TL) 전략을 제안하고 평가한다. 특히 영어(en-US) 사전 훈련 모델을 사용해 인코더와 예측 네트워크를 초기화함으로써, 이중 단계 TL 방법(음소 수준의 타겟 사용)을 통해 랜덤 초기화 대비 최대 17.4% 상대적 단어 오류율(WER) 감소와 더 빠른 훈련 수렴을 달성한다.
Transfer learning (TL) is widely used in conventional hybrid automatic speech recognition (ASR) system, to transfer the knowledge from source to target language. TL can be applied to end-to-end (E2E) ASR system such as recurrent neural network transducer (RNN-T) models, by initializing the encoder and/or prediction network of the target language with the pre-trained models from source language. In the hybrid ASR system, transfer learning is typically done by initializing the target language acoustic model (AM) with source language AM. Several transfer learning strategies exist in the case of the RNN-T framework, depending upon the choice of the initialization model for encoder and prediction networks. This paper presents a comparative study of four different TL methods for RNN-T framework. We show 17% relative word error rate reduction with different TL methods over randomly initialized RNN-T model. We also study the impact of TL with varying amount of training data ranging from 50 hours to 1000 hours and show the efficacy of TL for languages with small amount of training data.
연구 동기 및 목표
- 제한된 텍스트 데이터를 가진 저자원 언어에 대해 강력한 엔드 투 엔드 ASR 모델을 훈련하는 데 도전하는 것.
- 저자원 RNN-T 시스템에서 훈련을 안정화하고 성능을 향상시키기 위해 전이 학습을 수단으로 삼는 것.
- 직접 초기화 및 이중 단계 미세조정을 포함한 여러 TL 전략을 평가하여 가장 효과적인 방법을 특정하는 것.
- 50시간에서 1000시간의 훈련 데이터에 이르는 다양한 데이터 스케일에서 TL의 유효성을 입증하는 것.
- 정확도 및 수렴 성능 향상을 입증하기 위해 랜덤 초기화 및 하이브리드 ASR 모델과의 성능을 비교하는 것.
제안 방법
- 대상 언어(hi-IN) RNN-T 모델의 인코더와/또는 예측 네트워크를 원천 언어(en-US) 모델의 사전 훈련된 가중치로 초기화함으로써 전이 학습을 적용한다.
- 이중 단계 전이 학습을 구현: 먼저 사전 훈련된 en-US 모델을 베이스로 하여 대상 언어 모델(hi-IN)을 사전 훈련하고, 그 후 전체 RNN-T를 대상 데이터로 미세조정한다.
- 이중 단계 사전 훈련 단계에서 음소 수준의 타겟을 사용하여 정렬 및 표현 학습을 향상시킨다.
- 네 가지 TL 전략을 비교: en-US 인코더 전용 초기화, en-US RNN-T 공동 모델 초기화, 음소 및 음소 수준 타겟을 사용한 이중 단계 TL, hi-IN 언어 모델을 사용한 하이브리드 초기화.
- 수렴 및 성능 비교의 공정성을 확보하기 위해 동일한 초모수(학습률, 배치 크기)로 모델을 훈련한다.
- 디코딩을 위해 80차원의 로그 멜 필터뱅크 특징을 사용하고, 프레임 스킵을 요인 2로 적용한다. 또한 5-그램 언어 모델을 사용한다.
실험 결과
연구 질문
- RQ1랜덤 초기화 대비 저자원 RNN-T 모델에서 전이 학습이 단어 오류율(WER) 감소에 얼마나 효과적인가?
- RQ2직접 초기화와 이중 단계 미세조정 중 어떤 전이 학습 전략이 더 낮은 WER와 더 빠른 훈련 수렴을 이끌어내는가?
- RQ3특히 50~1000시간 범위에서 훈련 데이터가 감소함에 따라 전이 학습의 성능는 어떻게 변화하는가?
- RQ4공동 훈련이 이루어진 en-US RNN-T 초기화보다 en-US CE 초기화가 더 우수한 성능를 보이는 이유는 무엇인가?
- RQ5사전 훈련된 모델을 사용한 전이 학습이 엔드 투 엔드 ASR 시스템과 하이브리드 ASR 시스템 간의 성능 격차를 저자원 언어에서 메워줄 수 있는가?
주요 결과
- 음소 타겟을 사용한 이중 단계 TL 방법이 무작위 초기화 대비 최대 17.4% 상대적 WER 감소를 달성하여 모든 다른 방법보다 뛰어난 성능를 보였다.
- 단지 50시간의 훈련 데이터만으로도 en-US CE 초기화가 무작위 초기화 대비 WER을 42.7% 상대적으로 감소시켜 뛰어난 데이터 효율성을 입증했다.
- 전이 학습 방법을 사용할 경우 훈련 손실이 무작위 초기화보다 훨씬 빠르게 수렴했으며, 첫 번째 에포크 손실이 이미 훨씬 낮았다.
- 이중 단계 TL 방법이 en-US CE 초기화 및 무작위 초기화보다 더 빠른 수렴을 보여, 더 우수한 모델 초기화 품질을 가짐을 시사했다.
- 전이 학습을 적용한 최고의 RNN-T 모델(WER 21.89%)은 하이브리드 ASR 모델(WER 22.32%)과 유사한 성능를 보여 경쟁 가능한 성능를 확보했다.
- 놀랍게도, en-US CE + hi-IN LM 초기화는 en-US CE 초기화 전용보다 성능이 열 劣하므로, 언어 모델 적합도가 맞지 않을 경우 부정적 간섭이 발생할 수 있음을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.