[论文解读] Multilingual Speech Recognition With A Single End-To-End Model
该论文提出了一种单一的端到端序列到序列模型,用于跨9种印度语言(脚本重叠极少)的多语言语音识别。通过在无显式语言监督的情况下联合训练所有语言的音素集合,该模型相比单语言基线模型实现了21%的相对WER降低,而通过引入语言条件编码器输入后,性能进一步提升了7%,表明其具备强大的跨语言泛化能力与隐式的语言解耦能力。
Training a conventional automatic speech recognition (ASR) system to support multiple languages is challenging because the sub-word unit, lexicon and word inventories are typically language specific. In contrast, sequence-to-sequence models are well suited for multilingual ASR because they encapsulate an acoustic, pronunciation and language model jointly in a single network. In this work we present a single sequence-to-sequence ASR model trained on 9 different Indian languages, which have very little overlap in their scripts. Specifically, we take a union of language-specific grapheme sets and train a grapheme-based sequence-to-sequence model jointly on data from all languages. We find that this model, which is not explicitly given any information about language identity, improves recognition performance by 21% relative compared to analogous sequence-to-sequence models trained on each language individually. By modifying the model to accept a language identifier as an additional input feature, we further improve performance by an additional 7% relative and eliminate confusion between different languages.
研究动机与目标
- 解决在数据有限且缺乏语言特异性组件的情况下训练多语言语音识别系统所面临的挑战。
- 探究统一的序列到序列模型是否能在存在显著脚本与语音差异的情况下,联合学习多种印度语言。
- 评估语言身份条件输入对模型性能及语言混淆的影响。
- 探究模型是否能实现语言间的语码转换,并理解语言模型在联合模型中对声学模型的主导程度。
提出的方法
- 在9种印度语言的语言特异性音素集合的并集中训练单一注意力机制序列到序列模型。
- 采用基于听、注意与拼写(LAS)的架构,使用双向RNN编码器和单向RNN解码器。
- 引入语言标识符作为额外输入特征,以条件化编码器,实现语言感知建模。
- 通过从编码器状态派生的上下文向量,应用注意力机制将声学特征与预测的音素序列对齐。
- 采用堆叠的80维对数梅尔倒谱特征,结合帧堆叠与步长处理,以减少序列长度。
- 通过合成数据、语言不匹配实验与语码转换测试来评估模型行为。
实验结果
研究问题
- RQ1当未提供语言身份时,联合多语言模型在多大程度上会混淆不同语言?
- RQ2模型是否能在训练期间未共同出现过的印度语言之间实现语码转换?
- RQ3对编码器施加语言身份条件后,对识别准确率与语言保真度有何影响?
- RQ4在联合模型中,语言模型在多大程度上主导声学模型?
- RQ5模型是否能将语音-音素内容与语言身份进行解耦表示?
主要发现
- 联合多语言模型相比独立训练每种语言的单语言模型,实现了21%的相对WER降低。
- 增加语言身份条件输入后,性能进一步提升了7%的相对值,完全消除了语言混淆。
- 模型极少生成混合脚本输出,表明即使无显式监督,也具备强大的隐式语言识别能力。
- 在合成的混合语言语句中,模型无法在泰米尔语与印地语之间实现语码转换,表明语言模型主导了声学模型。
- 当为乌尔都语语音输入提供印地语语言ID时,模型将音频转写为印地语脚本,表明其成功将语音-音素内容与语言身份解耦。
- 在编码器条件化设置下,模型对提供的语言ID具有高度忠实性,即使输入语音来自不匹配的语言也如此。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。