[논문 리뷰] AISPEECH-SJTU accent identification system for the Accented English Speech Recognition Challenge
이 논문은 Interspeech-2020 Accented English Speech Recognition Challenge에서 평균 정확도 83.63%를 기록하며 1등을 달성한 AISPEECH-SJTU 시스템을 제시한다. 이는 음성 인식 기반의 발음 후보도형(PPG) 특징을 이용한 발음 식별, TTS 기반 데이터 증강 기법을 통해 다양한 발음 데이터를 합성하고, 테스트 시 데이터 증강 및 계층적 다중 임베딩 융합 기법을 적용하여 제한된 학습 데이터 상황에서 성능을 향상시켰다.
This paper describes the AISpeech-SJTU system for the accent identification track of the Interspeech-2020 Accented English Speech Recognition Challenge. In this challenge track, only 160-hour accented English data collected from 8 countries and the auxiliary Librispeech dataset are provided for training. To build an accurate and robust accent identification system, we explore the whole system pipeline in detail. First, we introduce the ASR based phone posteriorgram (PPG) feature to accent identification and verify its efficacy. Then, a novel TTS based approach is carefully designed to augment the very limited accent training data for the first time. Finally, we propose the test time augmentation and embedding fusion schemes to further improve the system performance. Our final system is ranked first in the challenge and outperforms all the other participants by a large margin. The submitted system achieves 83.63\% average accuracy on the challenge evaluation data, ahead of the others by more than 10\% in absolute terms.
연구 동기 및 목표
- 160시간의 음성 데이터만을 활용한 저자원 발음 식별 문제에 대응하기 위해
- 보조적인 Librispeech 데이터셋을 효과적으로 활용하여 모델의 강건성과 일반화 능력을 향상시키기 위해
- 발음 모델링에 특화된 새로운 데이터 증강 기법을 통해 데이터 부족 문제를 해결하기 위해
- 테스트 시 데이터 증강 및 임베딩 융합 전략을 활용하여 시스템 성능을 향상시키기 위해
제안 방법
- 시스템은 음성 인식 모델을 음성 데이터와 Librispeech 데이터를 병합해 훈련시켜, 발화자 독립적인 발음 후보도형(PPG) 특징을 추출하고, 이를 발음 식별에 활용한다.
- 새로운 TTS 기반 데이터 증강 방법을 통해 다양한 발음 변형(발화자, 채널, 텍스트 변형 포함)을 합성하여 훈련 데이터를 풍부화시킨다.
- 테스트 시 데이터 증강은 테스트 음성 문장을 다수의 변형된 형태로 생성하고, 예측 결과를 평균화하여 강건성을 향상시킨다.
- 계층적 다중 임베딩 융합 모델은 여러 개의 훈련된 모델에서 유도된 임베딩을 통합하여 최종 분류 성능을 향상시킨다.
- ASR 훈련 과정에서 전통적인 데이터 증강(노이즈, 반사, 시간 왜곡)을 적용하여 PPG 특징의 품질을 향상시킨다.
- 최종 시스템은 성능이 뛰어난 설정에서 초기화된 다수의 모델을 융합하고, 융합된 임베딩에 대해 최종 분류기의 엔드 투 엔드 훈련을 수행한다.
실험 결과
연구 질문
- RQ1ASR 모델에서 유도된 발음 후보도형(PPG) 특징이 기존의 저수준 특징(FBANK)보다 발음 식별에서 뛰어난 성능을 보일 수 있는가?
- RQ2TTS 기반 데이터 증강 기법이 저자원 발음 식별 작업에서 얼마나 성능 향상에 기여하는가?
- RQ3테스트 시 데이터 증강 기법은 예측 분산을 줄이고, 새로운 테스트 데이터에 대한 일반화 능력을 향상시키는 데 얼마나 효과적인가?
- RQ4다양한 모델 예측을 융합하는 계층적 다중 임베딩 융합 모델이 추가로 정확도 향상에 기여할 수 있는가?
주요 결과
- PPG 기반 시스템은 개발 세트에서 챌린지 베이스라인 대비 15.03%의 절대적 성능 향상을 기록하여, 작업에 특화된 발화자 독립적 특징의 우수성을 입증했다.
- TTS 기반 데이터 증강은 다양한 설정에서 정확도를 2.15%에서 4.17%까지 향상시켜 모델의 강건성을 크게 향상시켰다.
- 테스트 시 데이터 증강은 다소 미미하지만 일관된 성능 향상을 가져왔으며, 예측 분산 감소에 기여하는 것으로 확인되었다.
- 최종 시스템은 평가 세트에서 평균 정확도 83.63%를 기록하여 1등을 달성했고, 2등 팀보다 11.23%포인트 높은 성능을 기록했다.
- 베이스라인 대비 개발 세트와 평가 세트 간의 성능 격차가 작아 일반화 능력 향상이 확인되었다.
- t-SNE 시각화 결과, 인도(IND) 발음은 잘 분리되어 있었지만, 미국(US) 발음은 다른 발음들과 높은 겹침을 보여, US 발음 식별 정확도가 낮은 이유를 설명했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.