Skip to main content
QUICK REVIEW

[论文解读] Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling

Jaejin Cho, Murali Karthick Baskar|arXiv (Cornell University)|Oct 4, 2018
Speech Recognition and Synthesis参考文献 18被引用 5
一句话总结

本文提出一种使用联合 CTC-attention 训练、迁移学习和多语言 RNN 语言模型的多语言序列到序列(seq2seq)自动语音识别(ASR)系统。结果表明,将先前训练的多语言模型微调至低资源目标语言可显著降低词错误率(WER),且集成 RNNLM 所带来的性能提升等效于训练数据量翻倍,尤其在低资源设置下效果显著。

ABSTRACT

Sequence-to-sequence (seq2seq) approach for low-resource ASR is a relatively new direction in speech research. The approach benefits by performing model training without using lexicon and alignments. However, this poses a new problem of requiring more data compared to conventional DNN-HMM systems. In this work, we attempt to use data from 10 BABEL languages to build a multi-lingual seq2seq model as a prior model, and then port them towards 4 other BABEL languages using transfer learning approach. We also explore different architectures for improving the prior multilingual seq2seq model. The paper also discusses the effect of integrating a recurrent neural network language model (RNNLM) with a seq2seq model during decoding. Experimental results show that the transfer learning approach from the multilingual model shows substantial gains over monolingual models across all 4 BABEL languages. Incorporating an RNNLM also brings significant improvements in terms of %WER, and achieves recognition performance comparable to the models trained with twice more training data.

研究动机与目标

  • 研究在联合 CTC-attention 框架下,从多语言 seq2seq 模型向低资源目标语言迁移学习的可行性。
  • 评估在解码过程中集成多语言 RNNLM 对提升识别准确率的有效性。
  • 分析模型架构与训练数据量对跨多种低资源语言迁移学习性能的影响。
  • 将多语言迁移学习与单语训练进行比较,重点关注 WER 和 CER 的改善情况。

提出的方法

  • 在 10 种 BABEL 语言上使用结合 CTC 与注意力机制的多目标损失函数(通过线性插值权重 λ 联合)训练混合 CTC-attention seq2seq 模型。
  • 编码器采用双向 LSTM 或深层 CNN 后接 BLSTM 以提取声学特征,CTC 与注意力目标共享编码器权重。
  • 通过第二阶段微调实现迁移学习:在不同数据量(5–20 小时)下对目标语言微调多语言模型。
  • 在每个目标语言的文本上独立训练一个字符级 RNNLM,并在解码阶段通过对数得分组合(log p = log p_hyp + β log p_lm)进行浅层融合。
  • 联合解码采用束搜索机制,结合 seq2seq 模型与 RNNLM 的假设,其中 β 被调优以平衡声学模型与语言模型得分。
  • 语言建模在推理阶段后处理应用,而非训练阶段,以保持模型灵活性并避免性能下降。
Fig. 1 : Hybrid attention/CTC network with LM extension: the shared encoder is trained by both CTC and attention model objectives simultaneously. The joint decoder predicts an output label sequence by the CTC, attention decoder and RNN-LM.
Fig. 1 : Hybrid attention/CTC network with LM extension: the shared encoder is trained by both CTC and attention model objectives simultaneously. The joint decoder predicts an output label sequence by the CTC, attention decoder and RNN-LM.

实验结果

研究问题

  • RQ1能否有效利用在 10 种 BABEL 语言上预训练的多语言 seq2seq 模型,通过迁移学习对 4 种未见的低资源目标语言进行微调?
  • RQ2在不同数据量下,解码过程中集成多语言 RNNLM 对识别性能的影响如何?
  • RQ3在低资源 ASR 中,迁移学习与语言建模对降低 WER 的相对贡献分别是什么?
  • RQ4RNNLM 集成带来的性能增益是否随可用训练数据量增加而提升,还是在低数据场景下最为有效?

主要发现

  • 与单语模型相比,从多语言先验模型进行迁移学习在所有 4 种目标语言上平均将 WER 降低 6%,且在不同数据量下均保持一致的增益。
  • 在解码阶段引入多语言 RNNLM 平均使 WER 降低约 6%,其中在低数据场景(如 5 小时数据)下增益最大。
  • 对于阿萨姆语,使用 5 小时数据进行 RNNLM 解码的 WER 改进程度等同于使用 20 小时数据重新训练的模型,展现出极高的数据效率。
  • 第二阶段微调与 RNNLM 集成相结合,在阿萨姆语上实现 WER 65.3%,塔加洛语 64.3%,斯瓦希里语 56.2%,老挝语 57.9%——性能与训练数据量翻倍的模型相当。
  • 无论在迁移学习中使用多少目标语言数据,RNNLM 均能提供一致的 WER 改进,表明其对数据稀缺具有强鲁棒性。
  • 结合多语言预训练与 RNNLM 解码的联合 CTC-attention 模型优于单语模型与独立 seq2seq 系统,在多种低资源语言上展现出强大的泛化能力。
Fig. 2 : Difference in performance for 5 hours, 10 hours, 20 hours and full set of target language data used to retrain a multilingual model from stage-1
Fig. 2 : Difference in performance for 5 hours, 10 hours, 20 hours and full set of target language data used to retrain a multilingual model from stage-1

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。