Skip to main content
QUICK REVIEW

[논문 리뷰] Open Source Automatic Speech Recognition for German

Benjamin Milde, Arne Köhn|arXiv (Cornell University)|2018. 07. 26.
Speech Recognition and Synthesis인용 수 12
한 줄 요약

이 논문은 Kaldi 툴킷을 사용하여 Tuda-De 및 Spoken Wikipedia Corpus 데이터셋에서 읽기 언어로 412시간의 데이터를 기반으로 훈련한, 공개적으로 이용 가능한 오픈소스 음성인식(ASR) 모델을 제시한다. Spoken Wikipedia 데이터를 통합함으로써 저자들은 Tuda-De 테스트 세트에서 최종 WER가 14.38%에 도달하는 데 성공했으며, 이는 이전에 얻은 최고의 오픈소스 모델 대비 26% 상대적 WER 감소에 해당한다. 이 모델은 화자 변동성과 마이크 종류에 대해 뛰어난 내성성을 보였다.

ABSTRACT

High quality Automatic Speech Recognition (ASR) is a prerequisite for speech-based applications and research. While state-of-the-art ASR software is freely available, the language dependent acoustic models are lacking for languages other than English, due to the limited amount of freely available training data. We train acoustic models for German with Kaldi on two datasets, which are both distributed under a Creative Commons license. The resulting model is freely redistributable, lowering the cost of entry for German ASR. The models are trained on a total of 412 hours of German read speech data and we achieve a relative word error reduction of 26% by adding data from the Spoken Wikipedia Corpus to the previously best freely available German acoustic model recipe and dataset. Our best model achieves a word error rate of 14.38 on the Tuda-De test set. Due to the large amount of speakers and the diversity of topics included in the training data, our model is robust against speaker variation and topic shift.

연구 동기 및 목표

  • 자유롭게 이용 가능한 훈련 데이터를 사용하여 고품질의 오픈소스 독일어 ASR 음성 모델을 개발하기 위해.
  • 독일어 ASR의 진입 장벽을 낮추기 위해 완전히 재배포 가능한 모델과 훈련 레시피를 제공하기 위해.
  • 데이터 확장 및 모델 정교화를 통해 이전에 얻은 최고의 오픈소스 독일어 ASR 모델을 초월하기 위해.
  • 클라우드 기반 음성 API 의존을 피함으로써 프라이버시를 보장하고 현지에서 배포 가능한 ASR 시스템을 가능하게 하기 위해.
  • 자원봉사자 기여 및 자동으로 정렬된 음성 데이터(Spoken Wikipedia)를 활용하여 강건한 ASR 모델을 훈련시킬 수 있음을 입증하기 위해.

제안 방법

  • Tuda-De 및 Spoken Wikipedia Corpus(SWC)라는 두 개의 오픈소스 데이터셋을 기반으로 Kaldi ASR 툴킷을 사용해 음성 모델을 훈련하는 방식.
  • 긴 부분적으로 정렬된 오디오 기록을 처리하기 위해 Sphinx 기반 정렬 및 반복적 모델 재훈련을 적용한 자동 음성인식 파이프라인 적용.
  • 훈련을 위해 유효하고 연속적인 음성 세그먼트를 추출하기 위해 음성 활동 검출(VAD) 기반의 스니펫 추출 방법 사용.
  • 표준 Kaldi 레시피를 사용해 GMM-HMM 및 TDNN-HMM 아키텍처를 모두 적용하고, 언어 모델 재평가 기능을 포함.
  • SWC 데이터의 품질과 양의 균형을 맞추기 위해 보수적이고 최소한의 잘라내기 전략 적용.
  • 오픈-보편 어휘 설정에서의 어휘 외 단어를 처리하기 위해 서브워드 또는 OOV 자음 발음 어휘 항목을 자동 생성.

실험 결과

연구 질문

  • RQ1자유롭게 이용 가능한 공공 라이선스가 부여된 음성 데이터만을 사용하여 고성능 오픈소스 독일어 ASR 모델을 훈련시킬 수 있는가?
  • RQ2Spoken Wikipedia Corpus의 추가가 기존 오픈소스 독일어 ASR 모델의 성능에 어떤 영향을 미치는가?
  • RQ3읽기 언어로만 훈련된 모델이 Verbmobil 코퍼스에서 관찰되는 자연스러운 대화형 언어에 얼마나 잘 일반화되는가?
  • RQ4실제 기록 조건에서 다양한 마이크 및 화자 유형에 따라 모델 성능은 어떻게 변하는가?
  • RQ5Spoken Wikipedia 프로젝트의 지속적 성장에 비추어 볼 때, 모델이 시간이 지남에 따라 새로운 데이터로 효과적으로 확장될 수 있는가?

주요 결과

  • Spoken Wikipedia 데이터를 통합한 후 Tuda-De 테스트 세트에서 모델의 단어오류율(WER)은 14.38%에 도달하였으며, 이는 이전에 얻은 최고의 오픈소스 모델 대비 26% 상대적 WER 감소에 해당한다.
  • 285시간의 Spoken Wikipedia 데이터 추가로 성능 향상이 크게 이루어졌으며, 최종 모델은 화자 변동성과 마이크 다양성에 대해 강력한 내성성을 보였다.
  • Verbmobil(VM1) 테스트 세트에서 모델은 도메인 전용 어휘를 사용해 WER 20.04%를 기록하였으며, 읽기 언어로만 훈련되었음에도 불구하고 대화형 언어에 대해 합리적인 성능을 보였다.
  • 모델은 다양한 기록 조건에서도 잘 작동하였으며, 하드웨어에 기인한 왜곡으로 인해 공식 평가에서 제외된 Realtek 마이크 데이터를 제외하고는 미미한 성능 저하만 보였다.
  • 훈련 레시피와 사전 훈련된 모델은 GitHub에 공개되어 있어 향후 연구 및 응용 분야에서 재현성과 확장성을 보장한다.
  • 모델 성능은 어휘 크기에 매우 민감하며, 큰 어휘 크기의 모델은 상당히 높은 오류율을 보이며, 이는 독일어 ASR에서 서브워드 또는 분해 기반 접근이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.