[논문 리뷰] CORAA: a large corpus of spontaneous and prepared speech manually validated for speech recognition in Brazilian Portuguese
이 논문은 수동으로 검증된 오디오-번역 쌍을 포함한 브라질 포르투갈어 음성 코퍼스인 CORAA v1을 소개한다. 이 코퍼스는 290.77시간에 달하며, 자연스럽고 준비된 말하기 방식을 모두 포함한다. 이 데이터셋은 강력한 음성 인식 모델의 훈련을 가능하게 하며, 미리 훈련된 Wav2Vec 2.0 XLSR-53 모델이 CORAA에서 24.18%의 단어 오류율(WER)을 기록하고 Common Voice에서 20.08%를 기록하여 실제 음성 현상이 반영된 브라질 포르투갈어 음성 인식 분야의 성과를 크게 향상시켰다.
Automatic Speech recognition (ASR) is a complex and challenging task. In recent years, there have been significant advances in the area. In particular, for the Brazilian Portuguese (BP) language, there were about 376 hours public available for ASR task until the second half of 2020. With the release of new datasets in early 2021, this number increased to 574 hours. The existing resources, however, are composed of audios containing only read and prepared speech. There is a lack of datasets including spontaneous speech, which are essential in different ASR applications. This paper presents CORAA (Corpus of Annotated Audios) v1. with 290.77 hours, a publicly available dataset for ASR in BP containing validated pairs (audio-transcription). CORAA also contains European Portuguese audios (4.69 hours). We also present a public ASR model based on Wav2Vec 2.0 XLSR-53 and fine-tuned over CORAA. Our model achieved a Word Error Rate of 24.18% on CORAA test set and 20.08% on Common Voice test set. When measuring the Character Error Rate, we obtained 11.02% and 6.34% for CORAA and Common Voice, respectively. CORAA corpora were assembled to both improve ASR models in BP with phenomena from spontaneous speech and motivate young researchers to start their studies on ASR for Portuguese. All the corpora are publicly available at https://github.com/nilc-nlp/CORAA under the CC BY-NC-ND 4.0 license.
연구 동기 및 목표
- 브라질 포르투갈어 음성 인식 연구에서 공개적으로 이용 가능한 자연스러운 말하기 데이터셋의 부족을 보완하기 위해.
- 대규모의 수동으로 검증된 오디오-번역 쌍 코퍼스를 제공하여 실제 음성 현상에 대한 음성 인식 모델의 강건성 향상에 기여하기 위해.
- 불순물, 채움말, 소음 환경 등에 대응할 수 있는 엔드 투 엔드 음성 인식 시스템의 개발을 지원하기 위해.
- 젊은 연구자들에게 브라질 포르투갈어 음성 인식 연구를 위한 기준 데이터셋을 제공함으로써 동기를 부여하기 위해.
- 다양한 말하기 스타일에서 표준화된 평가를 통해 다국어 및 강건한 음성 인식 시스템의 구축을 촉진하기 위해.
제안 방법
- ALIP, C-ORAL 브라질 I, Nurc-Recife, SP2010 등 기존의 네 가지 음성 코퍼스를 통합하여 일관된 번역 기준을 갖춘 단일 데이터셋으로 구성하였다.
- 인간 검증자가 오디오-번역 쌍을 수동으로 검증하여 고품질의 기준값을 확보하였다.
- 브라질 포르투갈어 오디오 290.77시간과 유럽 포르투갈어 오디오 4.69시간을 포함하였다.
- 엔드 투 엔드 음성 인식 훈련을 위해 CORAA 데이터셋에 사전 훈련된 Wav2Vec 2.0 XLSR-53 모델을 미세조정하였다.
- 번역 오류 분석을 수행하여 주로 단어 교환과 채움말 오인식과 같은 일반적인 오류 유형을 파악하였다.
- 테스트 및 개발 세트의 수정 작업을 시작하여 번역 정확도를 향상시키고 채움말 표현 방식을 표준화하였다.
실험 결과
연구 질문
- RQ1대규모 수동 검증 음성 코퍼스가 자연스러운 말하기를 다룰 수 있도록 브라질 포르투갈어 음성 인식 성능을 어떻게 향상시킬 수 있는가?
- RQ2자연스럽고 비공식적인 말하기를 포함할 경우 음성 인식 모델의 강건성과 일반화 능력에 어떤 영향을 미치는가?
- RQ3단어 교환, 생략, 채움말과 같은 일반적인 오류 유형이 실제 음성에서의 음성 인식 모델 성능에 어떤 영향을 미치는가?
- RQ4CORAA에서 미세조정된 Wav2Vec 2.0 기반 모델이 CORAA 및 Common Voice 벤치마크에서 최고 성능을 달성할 수 있는 정도는 어느 정도인가?
- RQ5채움말의 정규화 규칙을 어떻게 개선하여 번역 정확도와 모델 일반화 능력을 향상시킬 수 있는가?
주요 결과
- CORAA 테스트 세트에서 Wav2Vec 2.0 XLSR-53 모델이 24.18%의 단어 오류율(WER)을 기록하였다.
- Common Voice 테스트 세트에서는 동일한 모델이 20.08%의 단어 오류율을 기록하여 뛰어난 일반화 능력을 입증하였다.
- CORAA에서는 문자 오류율이 11.02%였고, Common Voice에서는 6.34%였으며, 문자 수준의 정렬 성능이 뛰어나다는 것을 시사한다.
- 유형 3 오류—단어 교환—가 가장 흔한 오류 유형이었고, 이는 뒤이어 단어 생략과 추가 오류가 뒤를 이었다.
- 채움말과 그 오인식이 주요 오류 원인이었으며, 이는 향상된 정규화 규칙이 필요함을 시사한다.
- 포괄적인 오류 분석 결과, 315개의 테스트 샘플에서 문자 오류율이 0.7에서 12 사이였고, 단어 교환 오류가 42건 발견되어 향후 데이터 정제의 필요성을 강조하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.