[论文解读] The ASRU 2019 Mandarin-English Code-Switching Speech Recognition Challenge: Open Datasets, Tracks, Methods and Results
本论文介绍了 ASRU 2019 年中文-英文代码切换语音识别挑战赛,发布了总计 500 小时中文语音和 240 小时句内中文-英文代码切换语音数据,涵盖三个赛道:带语言模型(LM)约束与不带语言模型约束的传统 DNN-HMM ASR,以及端到端(E2E)ASR。主要发现表明,数据增强、发音词典和语言识别显著提升了性能,其中 E2E 模型在使用频谱增强(spec-augment)和多任务学习时受益最大,尽管在此设置下传统系统仍优于 E2E 模型。
Code-switching (CS) is a common phenomenon and recognizing CS speech is challenging. But CS speech data is scarce and there' s no common testbed in relevant research. This paper describes the design and main outcomes of the ASRU 2019 Mandarin-English code-switching speech recognition challenge, which aims to improve the ASR performance in Mandarin-English code-switching situation. 500 hours Mandarin speech data and 240 hours Mandarin-English intra-sentencial CS data are released to the participants. Three tracks were set for advancing the AM and LM part in traditional DNN-HMM ASR system, as well as exploring the E2E models' performance. The paper then presents an overview of the results and system performance in the three tracks. It turns out that traditional ASR system benefits from pronunciation lexicon, CS text generating and data augmentation. In E2E track, however, the results highlight the importance of using language identification, building-up a rational set of modeling units and spec-augment. The other details in model training and method comparsion are discussed.
研究动机与目标
- 为解决中文-英文代码切换语音识别研究中开放、标准化数据集稀缺的问题。
- 建立一个通用的测试平台,用于评估和比较多种训练范式下的代码切换语音识别系统。
- 探究传统 DNN-HMM 与端到端(E2E)语音识别模型在处理句内中文-英文代码切换时的性能表现。
- 评估数据增强、语言建模和建模单元设计对代码切换语音识别性能的影响。
提出的方法
- 发布 500 小时纯中文语音数据和 240 小时句内中文-英文代码切换语音数据,附带转录文本及 ARPA 格式的三元语言模型(3-gram CS LM)。
- 设计三个评估赛道:(1) 固定三元语言模型的传统 ASR,(2) 无语言模型限制的传统 ASR,(3) 使用序列到序列模型的端到端 ASR。
- 鼓励使用数据增强技术,如通过并行翻译和指针-生成网络进行文本生成,以扩展训练数据。
- 在 E2E 模型中推广使用语言识别(LID)作为监督信号,以提升语言边界检测能力。
- 在传统系统和 E2E 系统中均应用频谱增强(spec-augment)进行数据增强,以提升模型鲁棒性。
- 使用混合错误率(MERR)相对于赛道 1 中基线三元语言模型的结果进行系统评估。
实验结果
研究问题
- RQ1当使用有限语言模型与无限制语言模型时,传统 DNN-HMM ASR 系统在中文-英文代码切换语音数据上的表现如何?
- RQ2如文本生成和发音词典扩展等数据增强技术在多大程度上能提升代码切换语音识别性能?
- RQ3端到端 ASR 模型与传统混合系统相比,在识别句内代码切换语音样本时表现如何?
- RQ4语言识别在提升端到端代码切换语音识别模型性能方面发挥何种作用?
- RQ5在多语言代码切换语音识别中,哪种建模单元设计——字符、词片(word piece)或音节——能实现最优性能?
主要发现
- 传统 DNN-HMM 系统在中文部分的错误率低于 5%,英文部分错误率低于 20%,展现出强劲的基线性能。
- 通过文本生成进行数据增强,特别是使用并行翻译和指针-生成网络,使语言建模的识别性能提升了 2%-4%。
- 在 E2E 模型中引入语言识别损失显著提升了性能,有助于模型在帧级别准确区分语言边界。
- 频谱增强(spec-augment)在传统系统和 E2E 系统中均带来了稳定且可靠的性能提升。
- E2E 赛道的优胜者采用了 Transformer 模型,结合多任务学习、标签平滑和模型检查点平均,成为所有 E2E 系统中表现最佳者。
- 尽管取得进展,E2E 模型在此挑战中仍未超越传统 DNN-HMM 系统,但性能差距正在缩小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。