Skip to main content
QUICK REVIEW

[论文解读] BembaSpeech: A Speech Recognition Corpus for the Bemba Language

Claytone Sikasote, Antonios Anastasopoulos|arXiv (Cornell University)|Feb 9, 2021
Speech Recognition and Synthesis被引用 7
一句话总结

本文介绍了 BembaSpeech,这是一个用于巴姆巴语(Bemba)的24小时读音语音语料库,巴姆巴语是赞比亚超过30%人口使用的低资源班图语。通过在该语料库上微调一个预训练的 DeepSpeech 英语模型,作者实现了 54.78% 的词错误率(WER),证明了仅使用少量、经筛选的语音数据即可构建端到端自动语音识别系统,适用于资源匮乏的非洲语言。

ABSTRACT

We present a preprocessed, ready-to-use automatic speech recognition corpus, BembaSpeech, consisting over 24 hours of read speech in the Bemba language, a written but low-resourced language spoken by over 30% of the population in Zambia. To assess its usefulness for training and testing ASR systems for Bemba, we train an end-to-end Bemba ASR system by fine-tuning a pre-trained DeepSpeech English model on the training portion of the BembaSpeech corpus. Our best model achieves a word error rate (WER) of 54.78%. The results show that the corpus can be used for building ASR systems for Bemba. The corpus and models are publicly released at https://github.com/csikasote/BembaSpeech.

研究动机与目标

  • 解决赞比亚语及非洲语言在自动语音识别(ASR)方面语言资源匮乏的问题。
  • 为占赞比亚人口逾30%的巴姆巴语创建一个公开可用、已预处理的语音语料库。
  • 证明利用预训练英语模型进行迁移学习,可实现端到端巴姆巴语 ASR 系统的可行性。
  • 为未来在班图语和非洲语言的低资源语音识别研究建立基线。

提出的方法

  • BembaSpeech 语料库从赞比亚的100名母语者处收集,录音在受控环境中进行读音语音。
  • 该数据集包含24小时已转录的语音,划分为训练集(17.5小时)、验证集(3.5小时)和测试集(3小时)。
  • 使用初始学习率为 0.00005 的预训练 DeepSpeech 模型,在 BembaSpeech 训练集上进行微调。
  • 使用 KenLM 在转录文本和来自 JW300 语料库的额外巴姆巴语文本上训练语言模型,以提升 ASR 性能。
  • 最终模型将微调后的声学模型与仅基于训练和验证转录文本生成的 5-gram 语言模型相结合。
  • 模型评估采用标准指标:词错误率(WER)和字符错误率(CER),训练期间使用早停法和 dropout 正则化。

实验结果

研究问题

  • RQ1预训练的英语 ASR 模型能否在低资源巴姆巴语语音语料库上有效微调,以实现可接受的性能?
  • RQ2在巴姆巴语 ASR 系统中引入语言模型会对性能产生何种影响?
  • RQ3将来自外部来源(如 JW300 语料库)的额外巴姆巴语文本纳入是否能提升 ASR 性能?
  • RQ4通过迁移学习训练的巴姆巴语 ASR 模型性能与从零开始训练的模型相比如何?
  • RQ5为最大化 WER 改进,语言模型 n-gram 大小和数据源的最佳配置是什么?

主要发现

  • 性能最佳的模型通过微调预训练的 DeepSpeech 模型,并结合使用转录文本训练的 5-gram 语言模型,实现了 54.78% 的词错误率(WER)。
  • 引入语言模型使 WER 从仅使用微调模型的 71.21% 降低至 54.78%,表明性能有显著提升。
  • 在 3-gram 语言模型中加入 JW300 语料库的外部巴姆巴语文本后,WER 略微上升至 55.65%,表明在此设置下该数据源无益处。
  • 从零开始训练的基线模型 WER 为 85.67%,凸显了在低资源环境下迁移学习的优势。
  • 使用学习率 0.00005 和 0.4 的 dropout 率进行微调可获得最佳结果,且通过早停法防止过拟合。
  • 语料库和训练模型已公开发布于 GitHub,支持未来研究与可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。