Skip to main content
QUICK REVIEW

[논문 리뷰] Subword Dictionary Learning and Segmentation Techniques for Automatic Speech Recognition in Tamil and Kannada

A Madhavaraj, Bharathi Pilar|arXiv (Cornell University)|2022. 07. 27.
Speech Recognition and Synthesis인용 수 8
한 줄 요약

이 논문은 대규모 텍스트 코퍼스에서 데이터 기반 알고리즘을 사용하여 서브워드 사전을 학습하기 위해 확장된-BPE, BPE, 그리고 Morfessor를 활용하여 타밀어와 칸나다어의 자동 음성 인식(ASR)을 위한 서브워드 모델링을 제안한다. 최대우도 추정과 비터비 추정을 WFST 프레임워크 내에서 적용하여 서브워드 분할과 모델 학습을 최적화한다. 이 방법은 어휘 수가 무한한 고도로 통합어인 언어에서 단어 수준의 ASR 대비 단어 오류율(WER)을 최대 6.63% 감소시키며, 어휘 외 단어(OOV) 비율이 0%에 도달하여 성능 향상이著명하다.

ABSTRACT

We present automatic speech recognition (ASR) systems for Tamil and Kannada based on subword modeling to effectively handle unlimited vocabulary due to the highly agglutinative nature of the languages. We explore byte pair encoding (BPE), and proposed a variant of this algorithm named extended-BPE, and Morfessor tool to segment each word as subwords. We have effectively incorporated maximum likelihood (ML) and Viterbi estimation techniques with weighted finite state transducers (WFST) framework in these algorithms to learn the subword dictionary from a large text corpus. Using the learnt subword dictionary, the words in training data transcriptions are segmented to subwords and we train deep neural network ASR systems which recognize subword sequence for any given test speech utterance. The output subword sequence is then post-processed using deterministic rules to get the final word sequence such that the actual number of words that can be recognized is much larger. For Tamil ASR, We use 152 hours of data for training and 65 hours for testing, whereas for Kannada ASR, we use 275 hours for training and 72 hours for testing. Upon experimenting with different combination of segmentation and estimation techniques, we find that the word error rate (WER) reduces drastically when compared to the baseline word-level ASR, achieving a maximum absolute WER reduction of 6.24% and 6.63% for Tamil and Kannada respectively.

연구 동기 및 목표

  • 타밀어와 칸나다어처럼 어휘 수가 무한한 고도로 통합어인 언어에서 단어 수준의 ASR이 높은 어휘 외 단어(OOV) 비율을 겪는 문제를 해결한다.
  • 모르포로지컬 복잡성을 효과적으로 다루고 저자원, 형태학적으로 풍부한 언어에서 OOV 비율을 감소시키는 서브워드 모델링 기법을 개발한다.
  • BPE, 확장된-BPE, Morfessor와 같은 데이터 기반 알고리즘을 활용해 대규모 텍스트 코퍼스에서 서브워드 사전을 학습함으로써 ASR 성능을 향상시킨다.
  • 최대우도 추정과 비터비 추정을 WFST 프레임워크 내에서 통합하여 서브워드 분할과 모델 학습을 최적화한다.
  • 실세계 타밀어와 칸나다어 음성 데이터셋에 대한 광범위한 실험을 통해 서브워드 모델링의 효과성을 입증하며, 단어 수준 기준 대비 상당한 WER 감소를 보여준다.

제안 방법

  • 타밀어와 칸나다어의 형태학적 구조를 더 잘 포착하기 위해 추가 병합 히우리스틱을 통합한 표준 BPE를 개선한 확장된-BPE 알고리즘을 제안한다.
  • 가중 유한 상태 전이기계(WFST) 프레임워크 내에서 최대우도(ML) 및 비터비 추정 기법을 사용하여 대규모 텍스트 코퍼스에서 최적의 서브워드 분할을 학습한다.
  • BPE, 확장된-BPE, Morfessor 도구를 사용해 서브워드 사전을 구성하며, 모든 서브워드에 개별 문자를 포함시켜 0% OOV 비율을 확보한다.
  • Kaldi 툴킷을 사용해 학습된 사전에서 파생된 서브워드 어휘를 활용해 딥 네ural 네트워크(DNN) 기반 음성 모델을 훈련한다.
  • 서브워드 순서에 대해 최대 6-그램까지의 n-그램 언어 모델을 적용하여 언어 모델링 능력과 일반화 능력을 향상시킨다.
  • 최종 단어 순서를 재구성하기 위해 결정론적 규칙을 사용해 서브워드 출력을 후처리함으로써, 서브워드 기반 훈련에도 불구하고 전체적으로 단어 수준의 인식을 가능하게 한다.

실험 결과

연구 질문

  • RQ1서브워드 모델링은 타밀어와 칸나다어와 같이 고도로 통합어인 언어에서 자동 음성 인식(ASR)의 단어 오류율(WER)을 상당히 감소시킬 수 있는가?
  • RQ2BPE, 확장된-BPE, Morfessor와 같은 서로 다른 서브워드 사전 구성 기법 간에 WER 감소 및 OOV 비율 감소 측면에서 성능 비교는 어떻게 이루어지는가?
  • RQ3최대우도 추정 분할이 타밀어와 칸나다어 ASR 시스템에서 비터비 추정 분할보다 우월한가?
  • RQ4확장된-BPE와 Morfessor와 같은 데이터 기반 서브워드 모델링 기법은 저자원, 형태학적으로 풍부한 언어에서 OOV 비율을 어느 정도 감소시킬 수 있는가?
  • RQ5다양한 분할 및 추정 기법을 사용할 때, n-그램 언어 모델의 순서가 서브워드 ASR 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 서브워드 ASR 시스템은 단어 수준 기준 대비 타밀어에서 최대 6.24%의 절대 WER 감소, 칸나다어에서 최대 6.63%의 절대 WER 감소를 달성했다.
  • 확장된-BPE는 비터비 분할과 6-그램 서브워드 언어 모델을 사용할 때 가장 우수한 WER 성능을 보였으며, 타밀어에서는 14.97%, 칸나다어에서는 12.82%를 기록했다.
  • 모든 BPE 기반 방법(표준 및 확장된)은 서브워드 사전에 개별 문자를 포함시켜 0% 어휘 외 단어(OOV) 비율을 달성했다.
  • 최대우도(ML) 분할이 비터비 분할보다 우수했으며, 모든 가능한 분할 경로를 고려함으로써 WER 감소 효과가 더 컸다.
  • 타밀어의 경우, 확장된-BPE와 비터비 분할을 사용하고 6-그램 서브워드 언어 모델을 적용했을 때 최고의 WER 14.97%를 기록했으며, 이는 기준 대비 9.73%의 절대 개선을 의미한다.
  • 칸나다어의 경우, 확장된-BPE와 비터비 분할을 사용하고 6-그램 서브워드 언어 모델을 적용했을 때 최고의 WER 12.82%를 기록했으며, 이는 기준 대비 9.13%의 절대 개선을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.