Skip to main content
QUICK REVIEW

[논문 리뷰] Quran Recitation Recognition using End-to-End Deep Learning

Ahmad Al Harere, Khloud Al Jallad|arXiv (Cornell University)|2023. 05. 10.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 CNN-양방향 GRU 인코더와 Connectionist Temporal Classification (CTC) 및 문자 기반 베이즈 서치 디코더를 사용한 엔드 투 엔드 딥 러닝 모델을 제안한다. 공개된 Ar-DAD 데이터셋을 기반으로 훈련된 모델은 8.34%의 단어 오류율(WER)과 2.42%의 문자 오류율(CER)을 기록하여 이 데이터셋에 대한 향후 연구의 새로운 기준을 설정한다.

ABSTRACT

The Quran is the holy scripture of Islam, and its recitation is an important aspect of the religion. Recognizing the recitation of the Holy Quran automatically is a challenging task due to its unique rules that are not applied in normal speaking speeches. A lot of research has been done in this domain, but previous works have detected recitation errors as a classification task or used traditional automatic speech recognition (ASR). In this paper, we proposed a novel end-to-end deep learning model for recognizing the recitation of the Holy Quran. The proposed model is a CNN-Bidirectional GRU encoder that uses CTC as an objective function, and a character-based decoder which is a beam search decoder. Moreover, all previous works were done on small private datasets consisting of short verses and a few chapters of the Holy Quran. As a result of using private datasets, no comparisons were done. To overcome this issue, we used a public dataset that has recently been published (Ar-DAD) and contains about 37 chapters that were recited by 30 reciters, with different recitation speeds and different types of pronunciation rules. The proposed model performance was evaluated using the most common evaluation metrics in speech recognition, word error rate (WER), and character error rate (CER). The results were 8.34% WER and 2.42% CER. We hope this research will be a baseline for comparisons with future research on this public new dataset (Ar-DAD).

연구 동기 및 목표

  • 최근에 공개된 Ar-DAD 데이터셋을 활용하여 쿠란 낭독 인식 분야에서 공개적이고 대규모의 데이터셋이 부족한 문제를 해결하고자 한다.
  • 쿠란 낭독의 고유한 발음 규칙과 억양 규칙을 처리할 수 있는 강력한 엔드 투 엔드 딥 러닝 모델을 개발하고자 한다.
  • 표준화된 메트릭을 사용하여 공개 데이터셋에서 훈련 및 평가함으로써 향후 연구를 위한 재현 가능한 기반을 마련하고자 한다.
  • 이전 연구들이 소규모 비공개 데이터셋과 전통적인 음성인식(ASR) 또는 오류 분류 접근 방식에 의존한 점을 극복하고자 한다.
  • CTC와 베이즈 서치 디코딩을 활용한 엔드 투 엔드 학습으로 정확도를 향상시키고자 한다.

제안 방법

  • 모델는 원시 음성 입력에서 계층적인 음향 특징을 추출하기 위해 CNN-양방향 GRU 인코더를 사용한다.
  • 모델를 훈련하기 위해 강제 정렬이 필요하지 않은 Connectionist Temporal Classification(CTC)를 목적 함수로 사용한다.
  • 인코딩된 표현에서 최종 텍스트를 생성하기 위해 범주 기반 디코더와 베이즈 서치를 적용한다.
  • 모델는 37개의 장을 30명의 다른 낭독자가 다양한 속도와 발음 규칙으로 낭독한 데이터를 포함한 Ar-DAD 데이터셋에서 훈련 및 평가된다.
  • 모델 아키텍처는 표준 음성에서 찾을 수 없는 쿠란어의 특정 발음 규칙을 포함한 언어학적 복잡성을 처리하도록 설계되었다.
  • 평가에서는 표준 자동 음성인식 메트릭인 단어 오류율(WER)과 문자 오류율(CER)을 사용한다.

실험 결과

연구 질문

  • RQ1공개 데이터셋을 사용하여 엔드 투 엔드 딥 러닝 모델이 쿠란 낭독 인식에서 높은 정확도를 달성할 수 있는가?
  • RQ2CTC와 베이즈 서치 디코더를 적용한 제안된 CNN-BiGRU 모델은 표준 기준 벤치마크에서 이전 방법과 비교해 어떻게 성능을 내는가?
  • RQ3발음 규칙과 변동하는 낭독 속도가 실제 쿠란 음성에서 인식 성능에 얼마나 큰 영향을 미치는가?
  • RQ4Ar-DAD와 같은 공개 데이터셋이 쿠란 낭독 인식 시스템의 신뢰성 있고 재현 가능한 평가를 지원할 수 있는가?
  • RQ5쿠란어 음성 인식에서 WER와 CER를 최소화하기 위해 모델 구성 요소의 최적 설정은 무엇인가?

주요 결과

  • 제안된 모델은 Ar-DAD 데이터셋에서 8.34%의 단어 오류율(WER)을 기록하여 쿠란 낭독 인식에서 뛰어난 성능을 보였다.
  • 문자 오류율(CER)은 2.42%로, 종교적 텍스트의 정확한 전사에 매우 중요한 수준의 높은 정확도를 나타냈다.
  • 공개된 Ar-DAD 데이터셋을 활용함으로써 향후 연구와의 공정하고 재현 가능한 비교가 가능해졌으며, 이는 이전 연구에서 비공개 데이터를 사용한 한계를 해결하였다.
  • CTC와 베이즈 서치 디코딩을 통한 엔드 투 엔드 아키텍처는 쿠란 낭독의 언어학적 복잡성과 변동성을 효과적으로 처리하였다.
  • 결과적으로 이 연구는 Ar-DAD 데이터셋에서 훈련된 모델을 대상으로 한 향후 연구를 위한 새로운 기준을 설정하였다.
  • 모델는 낭독 속도의 변동성과 발음 규칙의 다양성에 대해 강건함을 보였으며, 이는 쿠란어 음성 인식의 핵심 과제이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.