Skip to main content
QUICK REVIEW

[논문 리뷰] Building a Unified Code-Switching ASR System for South African Languages

Emre Yılmaz, Astik Biswas|arXiv (Cornell University)|2018. 07. 28.
Speech Recognition and Synthesis참고 문헌 18인용 수 7
한 줄 요약

이 논문은 14.3시간 분량의 TV 드라마 코퍼스를 새로 구축하여, 영어, 아프리카누어, 셰소토, 세투아나, 소소토 등 5개 남아프리카 언어를 포함한 코드스위칭(CS) 음성에 대해 처음으로 통합된 다국어 자동 음성 인식(ASR) 시스템을 제시한다. 시스템은 네 개의 CS 언어 쌍(영어-아프리카누어, 영어-아프리카누어, 영어-세투아나, 영어-소소토)에 대해 훈련된 공유 음향 모델과 보간된 n-gram을 사용한 통합 언어 모델을 활용하며, 테스트 세트에서 55.6%의 WER를 기록한다. 그러나 성능은 언어에 따라 크게 다름. 특히 텍스트 데이터가 부족한 소소토의 경우 성능 저하가 뚜렷하다.

ABSTRACT

We present our first efforts towards building a single multilingual automatic speech recognition (ASR) system that can process code-switching (CS) speech in five languages spoken within the same population. This contrasts with related prior work which focuses on the recognition of CS speech in bilingual scenarios. Recently, we have compiled a small five-language corpus of South African soap opera speech which contains examples of CS between 5 languages occurring in various contexts such as using English as the matrix language and switching to other indigenous languages. The ASR system presented in this work is trained on 4 corpora containing English-isiZulu, English-isiXhosa, English-Setswana and English-Sesotho CS speech. The interpolation of multiple language models trained on these language pairs enables the ASR system to hypothesize mixed word sequences from these 5 languages. We evaluate various state-of-the-art acoustic models trained on this 5-lingual training data and report ASR accuracy and language recognition performance on the development and test sets of the South African multilingual soap opera corpus.

연구 동기 및 목표

  • 영어, 아프리카누어, 셰소토, 세투아나, 소소토 등 5개 남아프리카 언어를 포함한 다국어 코드스위칭 음성 인식 시스템을 개발하여, 다국어 통합 ASR 시스템이 저자원 언어를 포함한 코드스위칭 음성 인식에 효과적으로 작동할 수 있도록 한다.
  • 드라마 방송에서 유래한 다국어 코퍼스를 활용하여 저자원 아프리카 언어의 훈련 데이터 부족 문제를 해결한다.
  • 최신 신경 음향 모델과 보간된 언어 모델이 다국어 코드스위칭 음성에서 성능에 미치는 영향을 평가한다.
  • 특히 아프리카누어-아프리카누어 및 세투아나-소소토와 같은 언어적으로 유사한 언어 쌍 간의 언어 인식 정확도를 분석한다.
  • 저자원 언어인 소소토와 같이 텍스트 데이터가 풍부하지 않은 언어에서 성능 저하의 주요 원인을 규명한다.

제안 방법

  • 공유 음향 모델을 사용하여 네 개의 CS 언어 쌍(영어-아프리카누어, 영어-아프리카누어, 영어-세투아나, 영어-소소토)에 대해 통합 5국어 ASR 시스템을 훈련한다.
  • 모든 다섯 언어의 단언어 및 双언어 텍스트에서 훈련된 n-gram 언어 모델을 보간하여 통합 언어 모델을 구축하며, CS 훈련 데이터에 총 156,000개의 단어가 포함되어 있다.
  • 네 개의 CS 쌍의 통합 개발 및 테스트 데이터를 기반으로 신경 음향 모델을 훈련하며, 음성의 톤 특성을 고려해 성능 향상을 위해 음향 특징으로 피치를 사용한다.
  • 5-그램 레이스코어링을 적용하여 ASR 추론 결과를 정밀하게 보정하고 WER를 감소시킨다.
  • ASR 출력에서 예측된 언어 태그를 기반으로 언어 인식을 수행하며, 오분류 행렬을 사용해 이종 언어 간 오류를 평가한다.
  • 14.3시간 분량의 다국어 코드스위칭 코퍼스를 기반으로 시스템 성능을 평가하며, 혼합 언어 발화를 포함한 별도의 개발 및 테스트 세트를 사용한다.

실험 결과

연구 질문

  • RQ1영어, 아프리카누어, 셰소토, 세투아나, 소소토 등 5개 남아프리카 언어를 포함한 통합 다국어 ASR 시스템이 저자원 원주율 언어를 포함한 코드스위칭 음성 인식에 효과적으로 작동할 수 있는가?
  • RQ2훈련 시 다수의 CS 언어 쌍을 포함할 경우 전체 ASR 성능과 언어 인식 정확도에 어떤 영향을 미치는가?
  • RQ3언어적 유사성과 자원 부족이 언어 인식 성능에 미치는 영향은 무엇이며, 특히 아프리카누어-아프리카누어 및 세투아나-소소토 쌍에서 어떻게 나타나는가?
  • RQ4피치 특징과 레이스코어링이 음성 톤이 뚜렷한 코드스위칭 음성에서 ASR 성능 향상에 얼마나 기여하는가?
  • RQ5소소토는 음성 데이터는 다른 언어와 유사한데도 불구하고 WER가 현저히 높은 이유는 무엇이며, 이는 텍스트 데이터 부족과 어떤 관련이 있는가?

주요 결과

  • 5-그램 레이스코어링을 적용한 최고의 ASR 시스템은 테스트 세트에서 55.6%의 단어 오류률(WER)을 기록하며, 기준 모델 대비 약간의 향상이 있었다.
  • 영어 인식 성능은 약 42%의 WER로 유의하게 높았으며, 주로 영어 훈련 데이터의 양이 많기 때문이다.
  • 소소토의 WER는 70% 이상이었는데, 이는 세투아나와 유사한 음성 데이터를 보유하고 있음에도 불구하고 언어 모델 훈련에 사용된 텍스트 데이터가 단지 0.2M어휘에 불과하고, 세투아나의 경우 280만 어휘에 이를 대비해 텍스트 데이터 부족이 주요 원인이다.
  • 세투아나-소소토 쌍의 언어 인식 성능은 다른 언어 쌍보다 뚜렷하게 열 劣하였으며, 언어 유사성과 겹치는 음소 및 어휘 집합으로 인해 이중 방향 오분류가 빈번하게 발생했다.
  • 아프리카누어와 아프리카누어 간 오분류는 주로 한 방향으로 발생하며, 아프리카누어 단어가 아프리카누어로 잘못 인식되는 경우가 더 많았다. 이는 언어 간 구조적 또는 음성적 차이가 한 방향으로의 오류를 유리하게 만든다는 것을 시사한다.
  • 소소토 언어 그룹에 대해 단언어 및 코드스위칭 세그먼트에서 유사한 성능을 보였으며, 높은 오분류에도 불구하고 모델이 혼합 언어 발화에 잘 일반화되었음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.