[논문 리뷰] The CUHK-TUDELFT System for The SLT 2021 Children Speech Recognition Challenge
이 논문은 SLT 2021 어린이 음성 인식 챌린지에 참가한 CUHK-TUDELFT 시스템을 제시하며, 전문가 음성으로부터의 전이 학습, 데이터 증강(속도 왜곡, SpecAugment, RIR, 볼륨 왜곡), 하이브리드 언어 모델(4-그램 및 RNN-LM)을 활용한 공동 CTC-attention 엔드 투 엔드(E2E) 음성 인식(ASR) 프레임워크를 사용한다. 이 시스템은 테스트 세트에서 20.1%의 문자 오류율(CER)을 기록하여 전체 10위를 차지했으며, 공식 평가 세트에서는 23.6%의 CER를 기록했다.
This technical report describes our submission to the 2021 SLT Children Speech Recognition Challenge (CSRC) Track 1. Our approach combines the use of a joint CTC-attention end-to-end (E2E) speech recognition framework, transfer learning, data augmentation and development of various language models. Procedures of data pre-processing, the background and the course of system development are described. The analysis of the experiment results, as well as the comparison between the E2E and DNN-HMM hybrid system are discussed in detail. Our system achieved a character error rate (CER) of 20.1% in our designated test set, and 23.6% in the official evaluation set, which is placed at 10-th overall.
연구 동기 및 목표
- 제한된 데이터와 음향적 변동성으로 인해 어려움을 겪는 어린이 음성 인식을 위한 고성능 자동 음성 인식(ASR) 시스템을 개발하는 것.
- 특히 데이터가 부족한 조건에서 공동 CTC-attention 학습을 활용한 엔드 투 엔드(E2E) ASR의 효과성을 조사하는 것.
- 어른의 음성 데이터로부터의 전이 학습과 다양한 데이터 증강 기법이 E2E ASR 성능 향상에 기여하는지 평가하는 것.
- E2E ASR와 기존의 하이브리드 DNN-HMM 시스템 간의 성능를 비교하고, 다양한 언어 모델(LM) 통합 전략의 영향을 평가하는 것.
제안 방법
- 공동 CTC-attention 엔드 투 엔드 ASR 프레임워크를 사용하여, 순서 기반 시퀀스 모델링을 위해 연결주의 시간 분류(CTC)와 어텐션 기반 디코딩을 결합한다.
- 전이 학습은 341시간의 어른의 독서 음성(Set A)으로 E2E 모델을 사전 학습한 후, 어린이 음성(59시간, C1 및 C2)으로 미세 조정하여 적용한다.
- 데이터 증강에는 3방향 속도 왜곡, SpecAugment, 반향성(RIR), 볼륨 왜곡이 포함되어, 정확도 향상과 과적합 방지를 위한 강건성 향상에 기여한다.
- 두 가지 유형의 언어 모델을 사용한다: 4-그램 문자 수준의 언어 모델과 RNN-LM이며, 이들은 모두 E2E ASR 추론 결과를 재평가하여 정확도 향상에 기여한다.
- 비교를 위해 동일한 데이터와 언어 모델을 사용하는 하이브리드 DNN-HMM ASR 시스템도 개발하였으며, HMM 상태 전이와 음향 모델 기반 디코딩을 사용한다.
- 학습 데이터는 각각 Set A, C1, C2에 대해 발화자 수준에서 81% 학습, 9% 검증, 10% 테스트 세트로 분할되어 데이터 泄露를 방지한다.
실험 결과
연구 질문
- RQ1어른의 음성 데이터로부터의 전이 학습이 제한된 어린이 음성 데이터에서 E2E ASR 성능을 크게 향상시킬 수 있는가?
- RQ2속도 왜곡, SpecAugment, RIR 등의 다양한 데이터 증강 기법이 어린이 음성 인식에서 과적합을 줄이고 일반화 성능을 향상시키는 데 얼마나 효과적인가?
- RQ34-그램 언어 모델과 RNN-LM을 결합하여 E2E ASR에 통합하면 어린이 음성 인식에서 성능 향상이 눈에 띄게 발생하는가?
- RQ4특히 대화형 환경에서 어린이 음성을 인식할 때, E2E ASR 시스템의 성능가 하이브리드 DNN-HMM 시스템의 성능는 어떻게 비교되는가?
주요 결과
- 전이 학습 기반의 E2E ASR 시스템은 C1 및 C2의 통합 테스트 세트에서 20.1%의 문자 오류율(CER)을 기록하여 E2E 시스템 중 최고 성능를 달성했다.
- 속도 왜곡 외에 SpecAugment, RIR, 볼륨 왜곡을 추가로 적용한 데이터 증강은 E2E 시스템의 CER를 23.6%에서 21.2%로 감소시켜 뚜렷한 성능 향상을 입증했다.
- 4-그램 LM과 RNN-LM을 융합하여 E2E 시스템의 추론 결과를 재평가함으로써 CER는 20.1%로 감소했지만, 성능 저하를 방지하기 위해 언어 모델 및 디코더 가중치를 신중하게 튜닝할 필요가 있었다.
- 하이브리드 DNN-HMM 시스템은 RNN-LM 재평가를 통해 20.1%의 CER를 기록하여 최고의 E2E 시스템과 유사한 성능를 보였으며, 하이브리드 모델의 경쟁력이 높다는 것을 시사했다.
- '어른 전용' E2E 시스템은 C1에서는 12.4%의 CER를 기록했지만, C2에서는 56.0%의 CER를 기록하여 독서형 어린이 음성 대비 대화형 어린이 음성 인식의 어려움을 보여주었다.
- '어린이 전용' 시스템은 C1과 C2를 통합한 경우에선 '어른 전용' 시스템을 능가했지만, C1 단독으로는 성능이 열 劣화되어, 어른의 데이터는 독서형 음성 인식에 도움이 되지만, 대화형 스타일 인식에 있어서 어린이 데이터의 필수성이 높다는 점을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.