Skip to main content
QUICK REVIEW

[논문 리뷰] DARTS: Dialectal Arabic Transcription System

Sameer Khurana, Ahmed Ali|arXiv (Cornell University)|2019. 09. 26.
Speech Recognition and Synthesis참고 문헌 24인용 수 5
한 줄 요약

이 논문은 저자원 에지프트 아랍어 어조를 위한 딥 러닝 기반 음성-텍스트 변환 시스템인 DARTS를 제시한다. 이 시스템은 고자원 현대 표준 아랍어(MGB-2)에서의 전이 학습과 500시간 이상의 비라벨링 유튜브 오디오를 활용한 준감독 학습을 통해 개발되었으며, 하이브리드 DNN 아키텍처(컨볼루션 신경망, TDNN, LSTM 계층 포함), 순서 분류 학습, n-gram 및 RNN 언어 모델 리스코어링을 통해 MGB-3 평가 세트에서 최신 기술 수준의 단어 오류율(WER) 35.8%를 달성한다.

ABSTRACT

We present the speech to text transcription system, called DARTS, for low resource Egyptian Arabic dialect. We analyze the following; transfer learning from high resource broadcast domain to low-resource dialectal domain and semi-supervised learning where we use in-domain unlabeled audio data collected from YouTube. Key features of our system are: A deep neural network acoustic model that consists of a front end Convolutional Neural Network (CNN) followed by several layers of Time Delayed Neural Network (TDNN) and Long-Short Term Memory Recurrent Neural Network (LSTM); sequence discriminative training of the acoustic model; n-gram and recurrent neural network language model for decoding and N-best list rescoring. We show that a simple transfer learning method can achieve good results. The results are further improved by using unlabeled data from YouTube in a semi-supervised setup. Various systems are combined to give the final system that achieves the lowest word error on on the community standard Egyptian-Arabic speech dataset (MGB-3).

연구 동기 및 목표

  • 저자원 자동 음성 인식(ASR) 문제에 도전하며, 충분한 태깅된 데이터가 부족한 이집트 아랍어 어조에 대한 도전에 대응한다.
  • 고자원 현대 표준 아랍어(MSA) 방송 데이터(MGB-2)에서의 전이 학습이 저자원 어도의 아랍어(MGB-3)에 대해 얼마나 효과적인지 조사한다.
  • 이-domain의 비라벨링 유튜브 오디오(500시간 이상)를 활용한 준감독 학습을 통해 저자원 어도의 ASR 성능 향상 여부를 탐색한다.
  • MGB-3 벤치마크에서 기존 방법을 능가하는 견고한 엔드 투 엔드 음성 변환 시스템을 개발한다.
  • 이를 통해 모로코 아랍어와 같은 다른 아랍어 어도로의 일반화 능력을 평가한다. 전이 학습을 통해 가능할 것으로 기대된다.

제안 방법

  • 전면 컨볼루션 신경망(CNN), 다수의 시간 지연 신경망(TDNN) 계층, 장단기 기억(LSTM) 순환 계층을 조합한 깊이 있는 신경망 음성 모델을 훈련한다.
  • 태깅된 음성 인식을 위한 최적화를 위해 순서 분류 학습을 적용한다.
  • 먼저 1,200시간의 MGB-2 MSA 방송 데이터에서 사전 훈련을 수행한 후, 16시간의 태깅된 MGB-3 이집트 어도 데이터에서 미세 조정을 수행함으로써 전이 학습을 구현한다.
  • 이 시스템은 이집트 어도 채널의 500시간 이상의 비라벨링 유튜브 오디오를 준감독 학습 환경에 통합하여 모델 일반화 능력을 향상시킨다.
  • n-gram과 순환 신경망 언어 모델(RNNLM)을 모두 사용하여 디코딩을 수행하고, N-best 목록 리스코어링을 통해 변환 정확도를 향상시킨다.
  • 유한 상태 변환기(FST) 프레임워크를 사용해 언어 모델을 구성하고, 문법과 어휘를 통합하여 최종 디코딩 그래프를 구축한다.

실험 결과

연구 질문

  • RQ1고자원 MSA(MGB-2)에서의 전이 학습이 저자원 이집트 아랍어(MGB-3) 데이터의 ASR 성능을 크게 향상시킬 수 있는가?
  • RQ2이-domain의 비라벨링 유튜브 오디오를 활용한 준감독 학습이 어도 아랍어의 ASR 성능 향상에 얼마나 기여하는가?
  • RQ3깊이 있는 음성 모델(CNN-TDNN-LSTM)과 순서 분류 학습의 통합이 단순한 아키텍처에 비해 저자원 환경에서 어떻게 성능을 높이는가?
  • RQ4n-gram과 RNNLM을 사용한 언어 모델 리스코어링이 MGB-3 평가 세트의 단어 오류율(WER)에 어떤 영향을 미치는가?
  • RQ5제안된 DARTS 시스템은 전이 학습을 통해 모로코 아랍어와 같은 다른 아랍어 어도로 일반화될 수 있는가?

주요 결과

  • DARTS 시스템은 MGB-3 평가 세트에서 최신 기술 수준의 단어 오류율(WER) 35.8%를 달성하였으며, 이는 이전 최고 성능인 37.5%를 초월한다.
  • CNN 전처리 블록의 사용이 성능 향상에 기여하며, BLSTM 없이 전이 학습만을 적용한 DARTS 모델이 MGB-3에서 39.8%의 WER를 기록한다.
  • 500시간 이상의 비라벨링 유튜브 오디오를 활용한 준감독 학습은 DARTS 모델과 결합되었을 때 WER를 39.8%에서 39.5%로 감소시킨다.
  • 네 개 모델(DARTS, CNN-TDNN, DARTS-BLSTM, 유튜브 데이터를 활용한 CNN-TDNN)의 시스템 조합을 통해 리스코어링 이전에 WER를 36.5%로 감소시켰다.
  • 4-gram과 RNNLM을 사용한 언어 모델 리스코어링이 추가로 WER를 35.8%로 감소시켜 하이브리드 언어 모델링의 효과를 입증한다.
  • 기본 TDNN 모델 대비 모로코 아랍어(MGB-5)에서 5%포인트의 성능 향상을 기록하며(65% 대비 70% WER), 이는 전이 학습이 언어적으로 거리가 먼 어도 간에도 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.