[论文解读] Building a Unified Code-Switching ASR System for South African Languages
本论文提出了首个针对五种南非语言(英语、祖鲁语、科萨语、茨瓦纳语和索托语)的统一多语言自动语音识别(ASR)系统,用于跨语言混用(CS)语音识别,采用新收集的14.3小时电视剧语料库。该系统使用在四组混用语言对上训练的共享声学模型,以及通过插值n-gram构建的联合语言模型,在测试集上实现了55.6%的词错误率(WER),但各语言性能差异显著,尤其是索托语,由于文本数据有限,表现较差。
We present our first efforts towards building a single multilingual automatic speech recognition (ASR) system that can process code-switching (CS) speech in five languages spoken within the same population. This contrasts with related prior work which focuses on the recognition of CS speech in bilingual scenarios. Recently, we have compiled a small five-language corpus of South African soap opera speech which contains examples of CS between 5 languages occurring in various contexts such as using English as the matrix language and switching to other indigenous languages. The ASR system presented in this work is trained on 4 corpora containing English-isiZulu, English-isiXhosa, English-Setswana and English-Sesotho CS speech. The interpolation of multiple language models trained on these language pairs enables the ASR system to hypothesize mixed word sequences from these 5 languages. We evaluate various state-of-the-art acoustic models trained on this 5-lingual training data and report ASR accuracy and language recognition performance on the development and test sets of the South African multilingual soap opera corpus.
研究动机与目标
- 开发一个单一的多语言ASR系统,能够识别五种南非语言(包括本土班图语)中的语言混用语音。
- 通过利用电视剧广播中获得的多语言语料库,解决低资源非洲语言训练数据不足的挑战。
- 评估最先进神经声学模型和插值语言模型在多语言混用语音上的性能表现。
- 分析语言识别准确率,特别是语义上相近的语言对(如祖鲁语-科萨语和茨瓦纳语-索托语)之间的表现。
- 识别关键性能瓶颈,尤其是文本数据稀疏的低资源语言(如索托语)所面临的问题。
提出的方法
- 在四组混用语言对(英语-祖鲁语、英语-科萨语、英语-茨瓦纳语、英语-索托语)上训练统一的五语种ASR系统,采用共享声学模型。
- 通过插值所有五种语言的单语和双语文本训练的n-gram语言模型,构建联合语言模型,混用训练数据共包含15.6万个词。
- 在四组混用语言对的联合开发集和测试集上训练神经声学模型,使用音高特征以提升声调语言的性能。
- 应用五元n-gram解码路径重打分(lattice rescoring)以优化ASR假设并降低词错误率(WER)。
- 通过ASR输出预测的语言标签执行语言识别,使用混淆矩阵评估跨语言误分类情况。
- 系统在14.3小时的多语言混用语音语料库上进行评估,开发集和测试集均包含混合语言的语音片段。
实验结果
研究问题
- RQ1单一多语言ASR系统能否有效识别五种南非语言(包括低资源本土语言)中的混用语音?
- RQ2在训练中包含多组混用语言对,如何影响整体ASR性能和语言识别准确率?
- RQ3语言相似性与资源稀缺性对语言识别性能的影响如何,特别是对祖鲁语-科萨语和茨瓦纳语-索托语对?
- RQ4音高特征和解码路径重打分在声调混用语音识别中的性能提升程度如何?
- RQ5尽管声学数据相似,为何索托语的WER显著高于其他语言,这与文本数据稀缺性有何关联?
主要发现
- 在应用五元n-gram解码路径重打分后,最佳ASR系统的测试集词错误率(WER)为55.6%,相比基线模型仅实现微小提升。
- 英语识别表现显著更优(约42% WER),主要归因于英语训练数据量更大。
- 尽管声学数据与茨瓦纳语相当,索托语的WER仍超过70%,原因在于语言模型训练仅获得0.2百万词的文本数据,而茨瓦纳语有280万词。
- 在茨瓦纳语-索托语对上的语言识别性能明显低于其他语言对,表现为双向混淆严重,源于语言相似性及音素与词汇集的重叠。
- 科萨语与祖鲁语之间的混淆主要为单向,更多科萨语词被误识别为祖鲁语,表明结构或语音差异更有利于单向误识。
- 该系统在索托语的单语和混用语音片段上表现相似,表明模型在高混淆的混合语言语音上仍具备良好泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。