Skip to main content
QUICK REVIEW

[论文解读] The Makerere Radio Speech Corpus: A Luganda Radio Corpus for Automatic Speech Recognition

Jonathan Mukiibi, Andrew Katumba|arXiv (Cornell University)|Jun 20, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

本论文介绍了Makerere广播语音语料库,这是一个155小时的卢干达语广播语音数据集——撒哈拉以南非洲首个公开可用的广播语料库——旨在推动资源匮乏语言的自动语音识别(ASR)研究。通过在卢干达Common Voice和广播数据上微调一个卢旺达语ASR模型,作者在广播测试集上实现了47%的WER,并在使用热词增强技术进行新冠关键词检测时达到0.94的F-score,同时识别出转录中存在显著的性别偏差。

ABSTRACT

Building a usable radio monitoring automatic speech recognition (ASR) system is a challenging task for under-resourced languages and yet this is paramount in societies where radio is the main medium of public communication and discussions. Initial efforts by the United Nations in Uganda have proved how understanding the perceptions of rural people who are excluded from social media is important in national planning. However, these efforts are being challenged by the absence of transcribed speech datasets. In this paper, The Makerere Artificial Intelligence research lab releases a Luganda radio speech corpus of 155 hours. To our knowledge, this is the first publicly available radio dataset in sub-Saharan Africa. The paper describes the development of the voice corpus and presents baseline Luganda ASR performance results using Coqui STT toolkit, an open source speech recognition toolkit.

研究动机与目标

  • 为解决卢干达语——一种在东非有超过1500万人使用的资源匮乏的班图语——缺乏转录语音数据集的问题。
  • 鉴于广播是乌干达及撒哈拉以南非洲大部分地区的主要公共传播媒介,开发针对广播场景的卢干达语ASR系统。
  • 通过实现对广播脱口秀的自动监控,提升农村社区等群体公共话语的可及性,从而获取与政策相关的重要见解。
  • 评估并缓解在数据不平衡的语音数据上训练ASR模型时产生的性别偏差,特别是对代表性不足的女性语音的影响。
  • 发布一个公开可用的大规模广播语音语料库,以支持未来非洲语言在低资源语音识别和自然语言处理领域的研究。

提出的方法

  • 从多种来源(包括脱口秀、新闻和电话连线)收集并整理了155小时的卢干达语广播语音,以反映真实的广播环境。
  • 利用迁移学习技术,通过在Common Voice中203小时的朗读卢干达语音和120.7小时的广播数据上微调预训练的卢旺达语ASR模型(Coqui STT),实现模型优化。
  • 采用连接时序分类(CTC)实现端到端自动语音识别,无需强制对齐即可实现序列到序列建模。
  • 实施热词增强(HTWD-B)技术,以提升在低资源、噪声较大的广播环境中对特定关键词(如“covid”、“kolona”)的检测能力。
  • 从未见过的广播录音中构建了一个性别平衡的测试集(男性14分钟,女性14分钟),用于评估模型在不同说话人人口统计特征下的性能。
  • 使用词错误率(WER)和F-score指标评估ASR在通用任务和关键词特定任务中的表现,并通过人工验证转录结果。

实验结果

研究问题

  • RQ1迁移学习方法能否有效将预训练的卢旺达语ASR模型适配到卢干达语这一资源匮乏的班图语,实现可接受的性能?
  • RQ2在低资源广播ASR系统中,热词增强技术在提升新冠等关键公共卫生话题关键词检测效果方面有多有效?
  • RQ3训练数据中性别不平衡在多大程度上影响卢干达语ASR模型对男性与女性语音的识别性能?
  • RQ4基于端到端CTC的ASR模型在多样化、真实世界的卢干达语广播测试集上的表现如何?
  • RQ5公开发布的大型广播语音语料库能否显著推动非洲语言的自动语音识别研究?

主要发现

  • 卢干达语ASR模型在保留的广播测试集上实现了47%的词错误率(WER),证明了其在真实广播监控应用中的可行性。
  • 热词增强将关键词检测的F-score从0.89提升至0.94,使122个文件测试集中的假阴性数量从21例减少至14例。
  • 模型表现出显著的性别偏差,女性语音的WER高达70.6%,而男性语音为53.5%,反映出训练数据中男性占比81.9%。
  • Makerere广播语音语料库——包含155小时卢干达语广播语音——已公开发布,成为撒哈拉以南非洲首个此类语料库。
  • 本研究证实,通过相关语言(卢旺达语)的迁移学习,并结合特定领域微调,即使目标语言数据有限,也能构建功能有效的ASR模型。
  • 研究结果强调了数据收集平衡的重要性,女性语音代表性不足会导致实际部署中性能的可测量下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。