[论文解读] CORAA: a large corpus of spontaneous and prepared speech manually validated for speech recognition in Brazilian Portuguese
本论文介绍了CORAA v1,这是一个公开可用的巴西葡萄牙语语音语料库,时长达290.77小时,包含经人工验证的语音-转录配对数据,涵盖即兴和准备好的口语。该数据集可支持训练鲁棒的自动语音识别(ASR)模型,微调后的Wav2Vec 2.0 XLSR-53模型在CORAA上的词错误率(WER)达到24.18%,在Common Voice上的词错误率为20.08%,显著推进了真实语境下葡萄牙语语音识别技术的发展。
Automatic Speech recognition (ASR) is a complex and challenging task. In recent years, there have been significant advances in the area. In particular, for the Brazilian Portuguese (BP) language, there were about 376 hours public available for ASR task until the second half of 2020. With the release of new datasets in early 2021, this number increased to 574 hours. The existing resources, however, are composed of audios containing only read and prepared speech. There is a lack of datasets including spontaneous speech, which are essential in different ASR applications. This paper presents CORAA (Corpus of Annotated Audios) v1. with 290.77 hours, a publicly available dataset for ASR in BP containing validated pairs (audio-transcription). CORAA also contains European Portuguese audios (4.69 hours). We also present a public ASR model based on Wav2Vec 2.0 XLSR-53 and fine-tuned over CORAA. Our model achieved a Word Error Rate of 24.18% on CORAA test set and 20.08% on Common Voice test set. When measuring the Character Error Rate, we obtained 11.02% and 6.34% for CORAA and Common Voice, respectively. CORAA corpora were assembled to both improve ASR models in BP with phenomena from spontaneous speech and motivate young researchers to start their studies on ASR for Portuguese. All the corpora are publicly available at https://github.com/nilc-nlp/CORAA under the CC BY-NC-ND 4.0 license.
研究动机与目标
- 解决巴西葡萄牙语ASR研究中即兴口语数据集公开可用性不足的问题。
- 提供大规模、经人工验证的语音-转录语料库,以提升ASR模型对真实语境语音现象的鲁棒性。
- 支持端到端ASR系统的发展,使其能够处理不流畅表达、填充词及噪声环境。
- 通过提供葡萄牙语ASR研究的基准数据集,激励年轻研究者参与。
- 通过在多样化语音风格上进行标准化评估,促进多语言及鲁棒ASR系统的发展。
提出的方法
- 将四个现有语音语料库(ALIP、C-ORAL Brasil I、Nurc-Recife和SP2010)整合为统一数据集,并采用一致的转录标准。
- 由人工标注员对语音-转录配对进行人工验证,以确保高质量的基准数据。
- 包含巴西葡萄牙语和欧洲葡萄牙语的语音,其中巴西葡萄牙语为290.77小时,欧洲葡萄牙语为4.69小时。
- 在CORAA数据集上对预训练的Wav2Vec 2.0 XLSR-53模型进行微调,用于端到端ASR训练。
- 对转录结果进行错误分析,以识别常见错误类型,特别是词语互换和填充词误识别。
- 启动对测试集和开发集的修订流程,以提高转录准确性并统一填充词的表示方式。
实验结果
研究问题
- RQ1大规模、经人工验证的语音语料库在提升巴西葡萄牙语ASR性能方面,特别是在处理即兴口语方面,有何作用?
- RQ2包含即兴和非正式口语对ASR模型的鲁棒性和泛化能力有何影响?
- RQ3常见错误类型(如词语互换、遗漏和填充词)如何影响ASR模型在真实语境语音上的表现?
- RQ4基于Wav2Vec 2.0的模型在CORAA上微调后,能在CORAA和Common Voice基准上达到多高的SOTA性能?
- RQ5如何优化填充词的归一化规则,以提升转录准确性并增强模型泛化能力?
主要发现
- 在CORAA测试集上,经CORAA微调的Wav2Vec 2.0 XLSR-53模型达到24.18%的词错误率(WER)。
- 在Common Voice测试集上,同一模型达到20.08%的WER,表现出优异的泛化能力。
- CORAA上的字符错误率为11.02%,Common Voice上的字符错误率为6.34%,表明在字符级对齐方面表现强劲。
- 类型3的词汇错误(即词语互换)是最常见的错误类型,其次为词语遗漏和添加。
- 填充词及其错误表示是主要错误来源,凸显了改进归一化规则的必要性。
- 全面的错误分析显示,315个测试样本的CER介于0.7至12之间,其中42个实例存在词语互换错误,表明仍需进一步的数据清洗工作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。