[논문 리뷰] Research on Modeling Units of Transformer Transducer for Mandarin Speech Recognition
이 논문은 종단 간 중국어 음성 인식을 위한 하이브리드 자기주의 주의 Transformer와 RNN 아키텍처인 Transformer Transducer를 제안하며, 음절과 성조를 모델링 단위로 사용할 경우 가장 뛰어난 성능을 낸다. 성조가 포함된 음절을 사용할 경우 음절 초성/종성 모델링 대비 14.4% 상대적 WER 감소, 문자 수준 모델링 대비 44.1% 감소를 달성하며, 8kHz와 16kHz 오디오에서의 강건한 인식을 가능하게 하는 새로운 믹스 대역폭 훈련 방법을 도입한다.
Modeling unit and model architecture are two key factors of Recurrent Neural Network Transducer (RNN-T) in end-to-end speech recognition. To improve the performance of RNN-T for Mandarin speech recognition task, a novel transformer transducer with the combination architecture of self-attention transformer and RNN is proposed. And then the choice of different modeling units for transformer transducer is explored. In addition, we present a new mix-bandwidth training method to obtain a general model that is able to accurately recognize Mandarin speech with different sampling rates simultaneously. All of our experiments are conducted on about 12,000 hours of Mandarin speech with sampling rate in 8kHz and 16kHz. Experimental results show that Mandarin transformer transducer using syllable with tone achieves the best performance. It yields an average of 14.4% and 44.1% relative Word Error Rate (WER) reduction when compared with the models using syllable initial/final with tone and Chinese character, respectively. Also, it outperforms the model based on syllable initial/final with tone with an average of 13.5% relative Character Error Rate (CER) reduction.
연구 동기 및 목표
- 종단 간 중국어 음성 인식 성능을 향상시키기 위해 Transformer Transducer 아키텍처를 활용한다.
- 문자, 음절과 성조, 음절의 초성/종성 구성 요소와 같은 다양한 모델링 단위가 정확도에 미치는 영향을 조사한다.
- 새로운 훈련 전략을 통해 다양한 샘플링 속도(8kHz 및 16kHz)를 처리할 수 있는 일반 목적의 모델을 개발한다.
- 저자원, 대규모 어휘의 중국어 음성 인식 환경에서 모델 복잡도와 정확도 사이의 트레이드오프를 최적화한다.
제안 방법
- 자기주의 주의 메커니즘과 RNN 구성 요소를 융합한 하이브리드 Transformer Transducer 모델을 제안하여 맥락 모델링을 향상시킨다.
- 8kHz와 16kHz 오디오 데이터를 동시에 훈련하여 단일 강건한 모델을 생성하는 새로운 믹스 대역폭 훈련 방법을 적용한다.
- 다양한 모델링 단위를 평가: 중국어 문자, 성조가 포함된 음절, 성조가 포함된 음절의 초성/종성 구성 요소.
- 8kHz와 16kHz 양쪽 샘플링 속도에서 약 12,000시간 분량의 중국어 음성 데이터를 기반으로 모델을 훈련하고 미세조정한다.
- 라벨 스무딩을 적용한 교차 엔트로피 손실과 Transformer 블록 내에서 컨포머 스타일의 피드포워드 네트워크를 사용한다.
- 훈련 중에 CTC-주의 조율을 공동으로 적용하여 주의 훈련의 안정성을 높이고 음성 출력과 텍스트 출력 간의 정렬을 향상시킨다.
실험 결과
연구 질문
- RQ1문자, 성조가 포함된 음절, 성조가 포함된 음절의 초성/종성 구성 요소 중 어떤 모델링 단위가 중국어 음성 인식에서 가장 높은 정확도를 낼 수 있는가?
- RQ2단일 Transformer Transducer 모델이 별도의 재훈련 없이 8kHz와 16kHz 오디오 양쪽에서 강건한 성능을 달성할 수 있는가?
- RQ3기존의 단일 대역폭 훈련 방식에 비해 제안된 믹스 대역폭 훈련 방법은 일반화 능력과 오류율 측면에서 어떻게 비교되는가?
- RQ4순수한 Transformer나 RNN-T와 비교할 때, 자기주의 주의와 RNN 구성 요소를 융합한 아키텍처가 중국어 음성에서 장거리 의존성을 더 잘 모델링하는가?
- RQ5성조가 포함된 음절 모델링 방식이 문자 수준 모델링 대비 WER 및 CER 측면에서 상대적으로 얼마나 높은 성능 향상을 이룰 수 있는가?
주요 결과
- 성조가 포함된 음절을 모델링 단위로 사용할 경우 가장 낮은 단어 오류율(WER)을 기록하며, 음절의 초성/종성 구성 요소와 성조를 사용한 모델 대비 14.4% 상대적 WER 감소를 달성한다.
- 성조가 포함된 음절 모델은 문자 수준 모델링 대비 44.1% 상대적 WER 감소를 기록하여 뚜렷한 성능 향상을 입증한다.
- 성조가 포함된 음절 모델은 초성/종성 구성 요소와 성조를 사용한 기준 모델 대비 문자 오류율(CER)을 13.5% 상대적으로 감소시킨다.
- 믹스 대역폭 훈련 방법을 통해 단일 모델이 8kHz와 16kHz 오디오 양쪽에서 일반화되며, 미세조정 없이도 높은 정확도를 유지한다.
- 하이브리드 Transformer Transducer 아키텍처는 표준 RNN-T 및 순수한 Transformer 기반 모델에 비해 중국어 음성 인식에서 강건성과 정확도 측면에서 뛰어난 성능을 보인다.
- 결과는 모델링 단위가 성능에 상당한 영향을 미치며, 성조가 있는 음절이 중국어와 같은 성조어이자 고도로 형태학적으로 복잡한 언어에 최적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.