[论文解读] Semi-supervised Development of ASR Systems for Multilingual Code-switched Speech in Under-resourced Languages
本文提出一种批量半监督训练方法,以提升在五种南非语言中资源匮乏的多语言混合语料的自动语音识别(ASR)性能。通过利用未经转录且人工分割的肥皂剧音频,并借助双语及五语种ASR系统生成伪标签,该方法显著降低了词错误率(WER),其中批量训练优于非批量训练,且双语系统从五语种系统生成的伪标签中获益更多。
This paper reports on the semi-supervised development of acoustic and language models for under-resourced, code-switched speech in five South African languages. Two approaches are considered. The first constructs four separate bilingual automatic speech recognisers (ASRs) corresponding to four different language pairs between which speakers switch frequently. The second uses a single, unified, five-lingual ASR system that represents all the languages (English, isiZulu, isiXhosa, Setswana and Sesotho). We evaluate the effectiveness of these two approaches when used to add additional data to our extremely sparse training sets. Results indicate that batch-wise semi-supervised training yields better results than a non-batch-wise approach. Furthermore, while the separate bilingual systems achieved better recognition performance than the unified system, they benefited more from pseudo-labels generated by the five-lingual system than from those generated by the bilingual systems.
研究动机与目标
- 在标注数据有限的情况下,提升南非语种中资源匮乏的多语言混合语音的ASR性能。
- 评估利用南非肥皂剧中的未经转录且人工分割的语音数据进行半监督训练的有效性。
- 比较两种方法:四个独立的双语ASR系统与一个统一的五语种ASR系统在生成伪标签方面的表现。
- 研究批量训练与单次遍历训练对ASR性能的影响。
- 评估人工生成的混合语文本和合成三元语法对语言模型改进的贡献。
提出的方法
- 采用两种训练配置:在53小时未经转录且人工分割的混合语音上进行单次遍历和批量半监督训练。
- 使用四个双语ASR系统(英语-isiZulu、英语-isiXhosa、英语-Setswana、英语-Sesotho)和一个覆盖全部五种语言的五语种ASR系统生成伪标签。
- 将伪标签用于重新训练声学模型和语言模型,其中批量重新训练显示出更好的收敛性和性能。
- 通过真实转录和人工生成的混合语文本及合成三元语法构建语言模型,以降低困惑度。
- 使用词错误率(WER)和开发集与测试集上的混合语双词语法准确率(CSBA)评估性能。
- 以21小时标注的南非肥皂剧混合语语料库作为训练和评估的基础。
实验结果
研究问题
- RQ1批量半监督训练是否在资源匮乏的混合语音上比非批量训练带来更好的ASR性能?
- RQ2独立的双语ASR系统与统一的五语种ASR系统在识别准确率和数据稀疏性下的鲁棒性方面有何差异?
- RQ3与双语系统生成的伪标签相比,五语种系统生成的伪标签在多大程度上能提升双语ASR系统的性能?
- RQ4人工生成的混合语文本和合成三元语法是否能显著降低语言模型的困惑度并改善WER?
- RQ5多语种ASR系统中语言偏向(尤其是对英语的偏向)有何影响,尤其对班图语识别性能的影响如何?
主要发现
- 批量半监督训练在双语和五语种ASR系统中均比单次遍历训练更有效地降低了词错误率(WER)。
- 双语ASR系统在测试集上取得了更低的整体WER(30.3%),优于五语种系统(测试集WER为31.3%),表明其在班图语上的表现更优。
- 尽管复杂度更高,五语种系统在测试集上仍达到31.3%的WER,显示出在固有语言模糊性下仍具有强大性能。
- 五语种系统对英语表现出强烈偏向,英语WER显著较低(28.2%),而班图语则较高(如isiZulu为52.7%),而双语系统则更为平衡。
- 使用人工生成文本和合成三元语法训练语言模型,使WER降低1.2个百分点(从31.3%降至30.1%),并使混合语双词语法准确率提升7.4个百分点(从42.3%升至49.7%)。
- 双语系统从五语种系统生成的伪标签中获益多于从自身生成的伪标签,表明五语种系统为低资源语言对提供了更高质量的转录。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。