[论文解读] Bengali Common Voice Speech Dataset for Automatic Speech Recognition
本文介绍了孟加拉语通用语音语音数据集,这是一个通过 Mozilla 通用语音平台收集的众包、开源自动语音识别(ASR)语料库。在短短两个月内,该数据集便收集了超过 400 小时的多样化、句子级语音数据,其说话人、音素和环境变化的多样性均超过现有数据集,为未来的孟加拉语 ASR 研究建立了基准,并报告了模型性能指标。
Bengali is one of the most spoken languages in the world with over 300 million speakers globally. Despite its popularity, research into the development of Bengali speech recognition systems is hindered due to the lack of diverse open-source datasets. As a way forward, we have crowdsourced the Bengali Common Voice Speech Dataset, which is a sentence-level automatic speech recognition corpus. Collected on the Mozilla Common Voice platform, the dataset is part of an ongoing campaign that has led to the collection of over 400 hours of data in 2 months and is growing rapidly. Our analysis shows that this dataset has more speaker, phoneme, and environmental diversity compared to the OpenSLR Bengali ASR dataset, the largest existing open-source Bengali speech dataset. We present insights obtained from the dataset and discuss key linguistic challenges that need to be addressed in future versions. Additionally, we report the current performance of a few Automatic Speech Recognition (ASR) algorithms and set a benchmark for future research.
研究动机与目标
- 为解决孟加拉语这一高影响力但资源匮乏的语言所面临的开源、多样化语音数据集稀缺问题。
- 通过在 Mozilla 通用语音平台上的众包活动,收集大规模、句子级的 ASR 语料库。
- 利用真实世界中多样化语音数据,为训练和评估孟加拉语 ASR 系统提供基准。
- 识别低资源语音识别中孟加拉语的语言和数据多样性挑战。
提出的方法
- 通过 Mozilla 通用语音平台进行众包语音收集,使公众能够参与录制孟加拉语句子的语音。
- 数据收集聚焦于句子级转录,以支持端到端自动语音识别。
- 包含多样化说话人、地区口音以及各种背景噪声条件,以增强数据鲁棒性。
- 通过自动化和人工检查对数据集进行整理与验证,以确保转录准确性和语音质量。
- 使用标准自动语音识别架构和训练协议,在数据集上评估 ASR 模型。
- 从说话人、音素和环境多样性方面,将新数据集与现有的 OpenSLR 孟加拉语 ASR 数据集进行对比。
实验结果
研究问题
- RQ1孟加拉语通用语音数据集中说话人人口统计特征、音素和环境条件的多样性,与现有开源孟加拉语 ASR 数据集相比如何?
- RQ2在该新收集的数据集上训练时,最先进 ASR 模型可达到怎样的性能水平?
- RQ3数据集中仍存在哪些语言和数据质量挑战,可能影响下游 ASR 模型性能?
- RQ4该数据集的可扩展性和持续增长如何影响其在长期研究中的实用性?
- RQ5该数据集在多大程度上支持对背景噪声和孟加拉语语音区域差异的鲁棒性?
主要发现
- 孟加拉语通用语音数据集在短短两个月内收集了超过 400 小时的语音,显著扩展了孟加拉语 ASR 可用的训练数据。
- 与 OpenSLR 孟加拉语 ASR 数据集相比,该数据集在说话人、音素和环境条件方面的多样性更高。
- 初步的 ASR 模型评估表明,在新数据集上训练可实现可测量的性能提升,确立了新的基准。
- 该数据集的持续增长和开源特性,使其成为未来低资源语音识别研究的可持续资源。
- 语言挑战如地区发音差异和背景噪声依然存在,未来工作需采用针对性的建模方法加以应对。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。