[论文解读] Towards Language-Universal End-to-End Speech Recognition
本文提出一种语言无关的端到端语音识别系统,采用共享的通用字符集和语言特定的门控机制,联合识别多种语言,无需为每种语言设置特定的输出层。该模型在单语和多任务学习基线上表现更优,对低资源语言展现出强大的零样本初始化能力,并可实现性能损失极小的代码切换双语模型。
Building speech recognizers in multiple languages typically involves replicating a monolingual training recipe for each language, or utilizing a multi-task learning approach where models for different languages have separate output labels but share some internal parameters. In this work, we exploit recent progress in end-to-end speech recognition to create a single multilingual speech recognition system capable of recognizing any of the languages seen in training. To do so, we propose the use of a universal character set that is shared among all languages. We also create a language-specific gating mechanism within the network that can modulate the network's internal representations in a language-specific way. We evaluate our proposed approach on the Microsoft Cortana task across three languages and show that our system outperforms both the individual monolingual systems and systems built with a multi-task learning approach. We also show that this model can be used to initialize a monolingual speech recognizer, and can be used to create a bilingual model for use in code-switching scenarios.
研究动机与目标
- 通过构建一个支持多种语言的单一模型,解决多语言语音识别中的可扩展性和数据稀缺问题。
- 通过使用通用字符集实现端到端的音素级识别,消除对语言特定发音词典的需求。
- 通过引入语言特定的门控单元,以语言依赖的方式调制内部表征,改善多语言建模。
- 在真实多语言数据上评估模型性能,并检验其作为单语系统初始化方法的实用性。
- 探索通过仅使用字符集并集联合训练双语模型,实现端到端代码切换的可行性。
提出的方法
- 模型采用连接时序分类(CTC)框架,使用在所有语言间共享的通用字符集,替代语言特定的输出层。
- 引入语言特定的门控机制,其中语言身份通过每一层网络中的逐元素乘法交互来调制隐藏表征。
- 门控单元利用语言身份和当前隐藏状态计算门向量,随后以逐元素方式应用于隐藏表征。
- 模型通过所有可能的声学特征与标签序列对齐的最大似然准则进行端到端训练。
- 语言身份以独热向量形式编码,并作为门控机制的输入,实现对每种语言的动态适应。
- 在包含三种语言(英语、德语、西班牙语)的微软Cortana任务上进行评估,使用WER和CER作为指标。
实验结果
研究问题
- RQ1一个单一的端到端ASR模型是否能在不使用语言特定输出层的情况下,实现对多种语言的竞争力性能?
- RQ2使用通用字符集结合语言特定门控是否能优于标准多任务学习的多语言识别性能?
- RQ3该多语言模型是否可作为有限数据下训练单语模型的有效初始化方法?
- RQ4仅通过字符集并集联合训练,是否可行实现一个能处理双语代码切换的单一模型?
- RQ5通过门控机制引入语言身份,与仅在输入层使用语言嵌入相比,在识别准确率上表现如何?
主要发现
- 所提出的语言无关模型在不使用语言模型的情况下,相对于单语基线,分别在英语、德语和西班牙语上实现了7.0%、8.6%和11.1%的相对WER提升。
- 语言特定门控机制在所有语言感知方法中带来了最大的性能增益,优于仅使用语言嵌入或基于隐藏状态门控的模型。
- 在150小时德语数据上微调后,该模型在使用英语、德语和西班牙语预训练并加入门控机制后,CER达到19.4%,优于在更大规模单语英语数据上预训练的模型。
- 在150小时英语和150小时西班牙语数据上联合训练的双语模型,在英语和西班牙语测试集上的WER分别为38.8%和45.1%,与单语模型性能相当。
- 在未对德语数据进行微调的情况下,该模型仍达到20.6%的CER,证明了多语言预训练带来的强大零样本泛化能力。
- 当门控应用于每一层时性能最佳,表明在全网络中应用语言特定调制最为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。