Skip to main content
QUICK REVIEW

[논문 리뷰] Syllable based DNN-HMM Cantonese Speech to Text System

Timothy Wong, Claire W.Y. Li|arXiv (Cornell University)|2024. 02. 13.
Speech Recognition and Synthesis참고 문헌 19인용 수 3
한 줄 요약

이 논문은 캔타오어 음성-텍스트 인식을 위한 음절 기반 DNN-HMM 음성 모델을 제안하며, 초기-종성(IF)과 초성-핵음-종성(ONC) 음절 단위를 비교한다. GPU 가속 훈련과 I-벡터 발화자 적응을 사용한 Kaldi 툴킷을 활용하여, ONC 기반 모델은 9.66%의 단어 오류율과 1.388의 실시간 인식 요소를 기록하여 다른 설정들보다 뛰어난 성능을 보였다.

ABSTRACT

This paper reports our work on building up a Cantonese Speech-to-Text (STT) system with a syllable based acoustic model. This is a part of an effort in building a STT system to aid dyslexic students who have cognitive deficiency in writing skills but have no problem expressing their ideas through speech. For Cantonese speech recognition, the basic unit of acoustic models can either be the conventional Initial-Final (IF) syllables, or the Onset-Nucleus-Coda (ONC) syllables where finals are further split into nucleus and coda to reflect the intra-syllable variations in Cantonese. By using the Kaldi toolkit, our system is trained using the stochastic gradient descent optimization model with the aid of GPUs for the hybrid Deep Neural Network and Hidden Markov Model (DNN-HMM) with and without I-vector based speaker adaptive training technique. The input features of the same Gaussian Mixture Model with speaker adaptive training (GMM-SAT) to DNN are used in all cases. Experiments show that the ONC-based syllable acoustic modeling with I-vector based DNN-HMM achieves the best performance with the word error rate (WER) of 9.66% and the real time factor (RTF) of 1.38812.

연구 동기 및 목표

  • 쓰기 어려움을 겪는 독독성 장애가 있는 학생들을 위해 문장 표현 능력은 그대로 유지하면서 글쓰기 어려움을 해결할 수 있는 음성-텍스트 변환 시스템을 개발하기 위해.
  • 캔타오어에서 초성-핵음-종성(ONC)과 초기-종성(IF) 단위를 사용한 음절 수준의 음성 모델링 성능을 평가하기 위해.
  • DNN-HMM 아키텍처 내에서 I-벡터 기반 발화자 적응을 통해 정확도를 향상시키기 위해.
  • 딥 뉴럴 네트워크와 Kaldi 툴킷을 활용하여 실시간 성능과 단어 오류율(WER)을 최적화하기 위해.
  • 교육적 응용 분야에 적합한 강력하고 낮은 지연 시간을 가진 STT 시스템을 구축하기 위해.

제안 방법

  • 시스템은 GPU 가속을 사용한 확률적 경사 하강법으로 훈련된 하이브리드 DNN-HMM 아키텍처를 사용한다.
  • 음성 모델링은 음절 단위를 기반으로 하며, 초기-종성(IF)과 초성-핵음-종성(ONC)의 두 구조를 비교한다.
  • 일반화 능력을 향상시키기 위해 I-벡터 기반 발화자 적응 훈련(SAT)을 적용한다.
  • GMM-SAT 및 DNN 모델 간에 입력 특징을 공유하여 훈련 일관성을 확보한다.
  • 엔드 투 엔드 시스템 훈련과 디코딩을 위해 Kaldi 툴킷을 사용하며, 표준 레시피 기반 설정을 적용한다.
  • 시스템 성능 평가에는 단어 오류율(WER)과 실시간 요소(RTF)를 사용한다.

실험 결과

연구 질문

  • RQ1캔타오어 STT에서 ONC 기반 음절 단위를 사용할 경우, 기존의 IF 단위보다 인식 정확도가 향상되는가?
  • RQ2I-벡터 기반 발화자 적응은 캔타오어 DNN-HMM 시스템에서 단어 오류율을 어느 정도 감소시키는가?
  • RQ3발화자 적응 유무에 따라 음절 기반 DNN-HMM 시스템의 실시간 성능(RTF)은 어떻게 달라지는가?
  • RQ4음절 단위 선택(IF 대비 ONC)이 모델 복잡도와 추론 효율성에 어떤 영향을 미치는가?
  • RQ5음절 기반 DNN-HMM 시스템은 실시간 교육적 응용에 적합한 낮은 WER와 수용 가능한 RTF를 달성할 수 있는가?

주요 결과

  • I-벡터 적응을 적용한 ONC 기반 음절 모델은 9.66%의 최저 단어 오류율을 기록하였다.
  • 시스템은 1.388의 실시간 요소를 기록하여 실시간 배포에 적합한 효율적인 추론 성능를 확보하였다.
  • I-벡터 기반 DNN-HMM 설정은 WER 측면에서 IF 기반 모델과 비적응 모델보다 모두 뛰어난 성능을 보였다.
  • ONC 단위는 캔타오어에서 음절 내 음소 변형을 IF 단위보다 더 효과적으로 포착하였다.
  • DNN와 I-벡터 적응의 조합은 다양한 발화자 간의 강인성을 크게 향상시켰다.
  • 이 시스템은 독독성 장애 학습자를 대상으로 한 보조 기술 응용 분야에서 큰 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.