Skip to main content
QUICK REVIEW

[论文解读] Multilingual Speech Recognition using Knowledge Transfer across Learning Processes

Rimita Lahiri, Kenichi Kumatani|arXiv (Cornell University)|Oct 15, 2021
Speech Recognition and Synthesis参考文献 25被引用 4
一句话总结

本文提出了一种多语言语音识别框架,通过将语言ID的独热向量与元学习方法(LEAP)结合,实现跨学习过程的知识迁移,同时利用自监督学习(SSL),以最小化语言特定任务流形上的预期梯度路径长度,整体实现3.55%的相对WER降低,语言ID条件下实现3.51%的降低,优于基线SSL和单独使用LEAP的方法。

ABSTRACT

Multilingual end-to-end(E2E) models have shown a great potential in the expansion of the language coverage in the realm of automatic speech recognition(ASR). In this paper, we aim to enhance the multilingual ASR performance in two ways, 1)studying the impact of feeding a one-hot vector identifying the language, 2)formulating the task with a meta-learning objective combined with self-supervised learning (SSL). We associate every language with a distinct task manifold and attempt to improve the performance by transferring knowledge across learning processes itself as compared to transferring through final model parameters. We employ this strategy on a dataset comprising of 6 languages for an in-domain ASR task, by minimizing an objective related to expected gradient path length. Experimental results reveal the best pre-training strategy resulting in 3.55% relative reduction in overall WER. A combination of LEAP and SSL yields 3.51% relative reduction in overall WER when using language ID.

研究动机与目标

  • 在低资源和语言不平衡设置下,提升多语言自动语音识别(ASR)的性能。
  • 探究将语言ID作为独热向量输入是否能提升多语言ASR的准确性。
  • 通过元学习探索跨学习过程的知识迁移,特别采用LEAP框架以最小化预期梯度路径长度。
  • 将自监督学习(SSL)与元学习结合,以提升跨语言表征学习效果。
  • 评估语言ID、LEAP与SSL联合使用对多种语言词错误率(WER)的影响。

提出的方法

  • 模型采用Transformer Transducer架构,包含Transformer编码器和LSTM解码器,实现端到端训练。
  • 将语言ID作为独热向量输入,以指导每种语言的学习,提升低资源语言的表征能力。
  • 应用LEAP元学习框架,通过最小化在语言特定任务间训练过程中遍历的预期路径长度,优化模型初始化。
  • 在大规模未标注多语言数据上进行自监督学习(SSL)预训练,随后使用标注数据进行微调。
  • 训练流程结合了迭代式自训练与预训练,微调阶段使用AdamW,LEAP-SSL中使用Adam作为元优化器。
  • 目标函数结合了SSL对比损失与路径长度正则化项,以促进在语言任务间的高效学习。

实验结果

研究问题

  • RQ1将语言ID作为独热向量注入是否能提升多语言ASR性能,尤其是在低资源语言上?
  • RQ2通过元学习(LEAP)实现跨学习过程的知识迁移,能否减少预期梯度路径长度并提升多语言ASR准确性?
  • RQ3将LEAP与自监督学习(SSL)结合后,对多种语言的WER有何影响?
  • RQ4LEAP-SSL的性能提升是否依赖于语言ID信息的存在?
  • RQ5在SSL预训练与微调中使用相同数据,对多语言表征学习有何影响?

主要发现

  • 结合LEAP与SSL并输入语言ID,整体词错误率(WER)相对降低3.51%。
  • 使用语言ID作为独热向量,使俄语(RU)的WER相对降低21.06%,法语(FR-FR)降低20.69%,表明对特定语言有显著提升。
  • 若不使用语言ID,LEAP-SSL在大多数地区出现性能轻微下降,表明语言信息对有效元学习初始化至关重要。
  • 仅使用SSL可在所有语言上降低WER,尤其在未使用语言ID时表现更优,证明其在学习通用多语言表征方面的有效性。
  • 在引入语言ID的前提下,LEAP-SSL方法在除PT-BR外的所有语言中均实现一致的WER改进,PT-BR的增益微乎其微。
  • 整体最优预训练策略实现3.55%的相对WER降低,证实了所提知识迁移机制的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。