[논문 리뷰] Hindi-English Code-Switching Speech Corpus
이 논문은 인도의 다양한 지역, 성별, 연령대에서 온 71명의 화자로부터 수집한 총 7,005개의 발화를 포함하는 대규모 힌두어-영어(힌글리쉬) 코드 스위칭 음성 코퍼스를 제시한다. 이 코퍼스는 자동 음성 인식(ASR) 시스템의 훈련 및 평가를 지원하며, 3-그램 언어 모델을 사용한 DNN 음성 모델을 적용하여 25.40%의 단어 오류율(WER)을 기록하여, 인도의 저자원 코드 스위칭 ASR 연구 분야에서 중요한 기여를 한다.
Code-switching refers to the usage of two languages within a sentence or discourse. It is a global phenomenon among multilingual communities and has emerged as an independent area of research. With the increasing demand for the code-switching automatic speech recognition (ASR) systems, the development of a code-switching speech corpus has become highly desirable. However, for training such systems, very limited code-switched resources are available as yet. In this work, we present our first efforts in building a code-switching ASR system in the Indian context. For that purpose, we have created a Hindi-English code-switching speech database. The database not only contains the speech utterances with code-switching properties but also covers the session and the speaker variations like pronunciation, accent, age, gender, etc. This database can be applied in several speech signal processing applications, such as code-switching ASR, language identification, language modeling, speech synthesis etc. This paper mainly presents an analysis of the statistics of the collected code-switching speech corpus. Later, the performance results for the ASR task have been reported for the created database.
연구 동기 및 목표
- 인도에서 자동 음성 인식(ASR)을 위한 대규모이고 다양한 힌두어-영어 코드 스위칭 음성 자원의 부족을 해결하기 위해.
- 강건한 코드 스위칭 ASR 시스템을 향상시키기 위해 발음, 연령, 성별, 지리적 기원의 변동을 반영하는 대표성 있는 음성 코퍼스를 개발하기 위해.
- 최신 모델인 DNN 및 3-그램 언어 모델을 사용한 벤치마크 ASR 실험을 통해 코퍼스의 유효성을 검증하기 위해.
- 다국어 인도 환경에서의 언어 식별, 음성 합성, 언어 모델링 등의 후행 응용을 지원하기 위해.
제안 방법
- 21개의 인도 주에서 활동하는 71명의 모국어가 힌두어인 화자들로부터 총 7,005개의 발화를 수집하여 지리적, 연령대, 성별의 다양성을 확보하였다.
- 현장 컨설턴트를 활용한 체계적인 데이터 수집 프로토콜을 적용하여 통제된 환경에서 음성을 기록하였으며, 문장 내 및 문장 간 코드 스위칭 패턴을 포함하였다.
- MFCC 특징을 사용하여 오디오를 사전 처리하고, LDA 및 SAT 변환을 적용하여 음성 모델링 성능을 향상시켰다.
- Kaldi 툴킷을 사용하여 GMM 및 DNN 기반 음성 모델을 훈련하였으며, 훈련용 5,500개, 테스트용 1,505개의 발화를 활용하였다.
- IRSTLM 툴킷을 사용하여 11,566개의 훈련 문장에 기반한 3-그램 언어 모델을 구축하여 코드 스위칭 음성에서의 언어 이해도를 향상시켰다.
- 다양한 특징 집합을 사용한 단일 언어, 트라이포네, 딥 네ural 네트워크(DNN) 모델을 비교하여 단어 오류율(WER)을 사용해 성능을 평가하였다.
실험 결과
연구 질문
- RQ1인도 다국어 화자들 사이에서 자연스러운 힌두어-영어 음성에서 코드 스위칭 패턴(문장 내 vs. 문장 간)의 분포는 어떠한가?
- RQ2화자 인구 통계적 특성(연령, 성별, 지역)의 변화가 힌두어-영어 코드 스위칭 음성의 음향적 특성에 어떤 영향을 미치는가?
- RQ3기존의 GMM 기반 모델과 비교해 볼 때, 신규로 제작된 힌두어-영어 코드 스위칭 코퍼스에서 DNN 기반 음성 모델의 성능은 어떠한가?
- RQ4코드 스위칭 텍스트에 기반한 3-그램 언어 모델은 이 코퍼스에서 ASR 정확도 향상에 얼마나 기여하는가?
주요 결과
- 코퍼스는 71명의 화자(남성 44명, 여성 27명)로부터 총 7,005개의 발화를 포함하며, 21개의 인도 주와 20세에서 64세까지의 연령대를 반영하고 있다.
- 지리적 분포는 동부 지역이 40.84%, 북부 지역이 30.98%, 남부 지역이 18.33%, 서부 지역이 9.85%를 차지하여 지역 다양성을 확보하고 있다.
- LDA 및 SAT 특징을 적용한 DNN 기반 음성 모델이 25.40%의 가장 낮은 단어 오류율을 기록하여 GMM 기반 모델을 능가하였다.
- 가장 높은 성능을 보인 모델은 5개의 은닉층, 각각 1,024개의 뉴런, tanh 활성화 함수를 사용하며, 20 에포크 동안 미니배치 크기가 128인 환경에서 훈련되었다.
- 11,566개 문장에 기반한 3-그램 언어 모델은 인식 정확도를 크게 향상시켜, 코드 스위칭 ASR에서 언어 모델링의 중요성을 입증하였다.
- 코퍼스는 여전히 활발한 수집 중이므로, 향후 연구를 위해 크기 및 다양성을 더욱 확장하는 데 노력이 계속되고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.