[论文解读] Learning to Recognize Code-switched Speech Without Forgetting Monolingual Speech Recognition
本文提出使用无遗忘学习(LWF)框架在不损害单语性能的前提下,对端到端语音识别模型进行多语种切换语音的训练。通过在多语种切换数据微调过程中保留原始单语分布,LWF在无需原始单语训练数据的情况下,相较于标准微调和数据合并方法,在单语和多语种切换测试集上均实现了更低的词错误率(WER)。
Recently, there has been significant progress made in Automatic Speech Recognition (ASR) of code-switched speech, leading to gains in accuracy on code-switched datasets in many language pairs. Code-switched speech co-occurs with monolingual speech in one or both languages being mixed. In this work, we show that fine-tuning ASR models on code-switched speech harms performance on monolingual speech. We point out the need to optimize models for code-switching while also ensuring that monolingual performance is not sacrificed. Monolingual models may be trained on thousands of hours of speech which may not be available for re-training a new model. We propose using the Learning Without Forgetting (LWF) framework for code-switched ASR when we only have access to a monolingual model and do not have the data it was trained on. We show that it is possible to train models using this framework that perform well on both code-switched and monolingual test sets. In cases where we have access to monolingual training data as well, we propose regularization strategies for fine-tuning models for code-switching without sacrificing monolingual accuracy. We report improvements in Word Error Rate (WER) in monolingual and code-switched test sets compared to baselines that use pooled data and simple fine-tuning.
研究动机与目标
- 解决在多语种切换语音识别中因微调多语种数据而导致的灾难性遗忘问题,即微调后单语语音识别性能下降。
- 开发一种方法,在不依赖原始单语训练数据的前提下,提升多语种切换语音识别的准确性,同时保持单语识别性能。
- 提出正则化与微调策略,确保在有限多语种数据条件下,对单语和多语种语音均保持高准确率。
- 证明 LWF 框架可在无需访问原始单语训练数据的情况下,有效实现多语种切换的领域自适应。
- 倡导在多语种切换语音识别研究中报告单语性能,以确保模型的泛化能力。
提出的方法
- 采用无遗忘学习(LWF)框架,在无原始单语训练数据访问权限的情况下,对预训练的单语语音识别模型进行多语种切换语音的微调。
- 采用两阶段训练流程:首先,冻结共享层和单语专用层,仅训练新的多语种切换任务专用头(预热阶段)。
- 其次,联合微调所有层,包括共享层和单语组件,同时通过蒸馏损失保留原始模型的知识。
- 在微调阶段,通过知识蒸馏使新模型模仿原始单语模型在多语种切换输入上的输出概率。
- 对于可访问单语数据的情况,应用正则化与微调策略,联合优化单语与多语种性能。
- 采用基于 CTC 的端到端模型,共享编码器层,并为单语(θₘ)和多语种切换(θ_c)任务分别设置任务专用头。
实验结果
研究问题
- RQ1在多语种切换数据上微调单语语音识别模型是否会导致单语测试集性能下降,即由于灾难性遗忘?
- RQ2LWF 框架能否在提升多语种切换语音识别准确率的同时,有效保持单语识别性能?
- RQ3与标准微调和数据合并训练相比,基于 LWF 的方法在单语和多语种切换测试集上的 WER 表现如何?
- RQ4当无法获取单语训练数据时,LWF 方法是否仍有效,仅依赖预训练的单语模型?
- RQ5正则化与微调策略对单语与多语种语音识别联合性能的影响如何?
主要发现
- LWF 模型在泰米尔语单语测试集上达到 48.90 的 WER,优于单语基线模型(50.09 WER)和微调模型(50.03 WER)。
- 在泰卢固语-英语多语种切换数据上,LWF 模型实现 43.60 WER,优于同一测试集上最佳微调模型的 39.32 WER。
- LWF 模型降低了微调模型在单语性能上的下降,尤其在古吉拉特语中,微调模型的 WER 从 41.99 上升至 46.42,而 LWF 维持在 42.30 WER。
- LWF 模型在所有测试集上均优于使用多语种数据微调的合并模型,证明其在无需访问原始单语数据情况下的有效性。
- LWF 框架缓解了灾难性遗忘,实现了单语与多语种语音识别的联合优化,且无性能权衡。
- 研究表明,对多语种切换数据的标准微调会损害单语性能,凸显在多语言语音识别中采用持续学习技术的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。