Skip to main content
QUICK REVIEW

[논문 리뷰] AISHELL-1: An Open-Source Mandarin Speech Corpus and A Speech Recognition Baseline

Hui Bu, Jiayu Du|arXiv (Cornell University)|2017. 09. 16.
Speech Recognition and Synthesis참고 문헌 6인용 수 50
한 줄 요약

AISHELL-1은 대규모 개방형 Mandarin ASR 코퍼스로(400명 화자, 170시간 이상) Kaldi 베이스라인 및 즉시 사용 설정과 함께 상세한 녹음, 전사, 렉시콘 파이프라인을 제공합니다.

ABSTRACT

An open-source Mandarin speech corpus called AISHELL-1 is released. It is by far the largest corpus which is suitable for conducting the speech recognition research and building speech recognition systems for Mandarin. The recording procedure, including audio capturing devices and environments are presented in details. The preparation of the related resources, including transcriptions and lexicon are described. The corpus is released with a Kaldi recipe. Experimental results implies that the quality of audio recordings and transcriptions are promising.

연구 동기 및 목표

  • ASR 연구 및 제품 수준 개발에 적합한 개방적이고 대규모의 Mandarin 음성 코퍼스 제공.
  • 데이터 품질과 재현성을 보장하기 위한 녹음 절차, 메타데이터, 전사 및 렉시콘 준비를 상세히 설명.
  • 신뢰할 수한 Mandarin ASR 베이스라인을 확립하기 위한 드롭인 Kaldi 레시피 제공.
  • 다수의 음향 모델 및 채널에 걸친 기본 실험을 통해 코퍼스 품질을 입증.

제안 방법

  • AISHELL-1을 400 화자 및 170+ 시간의 더 큰 AISHELL-ASR0009 코퍼스 부분으로 공개.
  • 고충실도 마이크로폰, Android 및 iPhone 채널을 포함한 다중 디바이스 녹음 설정; 데이터는 16 kHz, 16-bit WAV로 재샘플링.
  • 수작업 전사, 텍스트 정규화, 초기-최종 발음이 포함된 중국어 렉시콘.
  • GMM-HMM에서 TDNN-HMM 및 MFCC 및 피치 피처와 함께 LFMMI로, 아이벡터 적응을 포함한 Kaldi 기반 ASR 베이스라인.
  • 오디오 증강 및 DNN 강건성 향상을 위한 아이벡터 기반 적응 사용.
  • 1.3 million 단어의 언어 모델 구축으로 트리그램 스무디 및 OOV 처리.
Fig. 1 : Recording setup
Fig. 1 : Recording setup

실험 결과

연구 질문

  • RQ1AISHELL-1이 다수의 디바이스에서 강력한 Mandarin ASR 연구와 실용 시스템 개발을 지원할 수 있는가?
  • RQ2모델 아키텍처(GMM-HMM, TDNN-HMM, LFMMI)가 AISHELL-1의 Mandarin ASR 성능에 어떤 영향을 미치는가?
  • RQ3디바이스 불일치가 AISHELL-1을 사용할 때 ASR 성능에 미치는 영향은 무엇인가?
  • RQ4AISHELL-1 베이스라인이 THCHS30과 같은 관련 없는 도메인 및 다른 언어 모델 도메인으로 일반화될 수 있는가?

주요 결과

  • AISHELL-1은 340명으로부터의 120,098개의 학습 발화, 40명의 개발에서의 14,326개, 20명의 테스트에서의 7,176개를 포함하며(화자당 약 26분).
  • Baseline 결과에서 LFMMI가 TDNN-HMM 및 MLLT+SAT보다 우수하며, LFMMI의 dev CER는 6.44%, test CER는 7.62%이다.
  • TDNN-HMM은 dev CER 7.23%, test CER 8.42%이며, 반면 MLLT+SAT는 dev 10.43%, test 12.23% CER이다.
  • 디바이스 불일치 테스트(iOS vs Android)에서 LFMMI는 Android에서 dev 10.90%, test 10.09% CER로 MLLT+SAT의 12.64% dev, 11.88% test보다 우수하며, TDNN-HMM은 최대 12.42%/10.81%까지이다.
  • AISHELL-1 모델을 THCHS30에 적용하면 모든 모델의 CER이 더 높아지며, 예를 들어 LFMMI는 THCHS30에서 25.00%로, 도메인 적응의 이점을 시사한다.
  • 결과는 코퍼스가 음소적으로 풍부하며 Kaldi 레시피로 Mandarin ASR 베이스라인 구축에 적합하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.