Skip to main content
QUICK REVIEW

[论文解读] Multi-task Recurrent Model for True Multilingual Speech Recognition

Zhiyuan Tang, Lantian Li|arXiv (Cornell University)|Sep 27, 2016
Speech Recognition and Synthesis参考文献 13被引用 3
一句话总结

本文提出了一种多任务循环模型,联合训练自动语音识别(ASR)和语言识别(LR)组件,以实现语言感知的多语言语音识别。通过将LR组件的实时语言预测结果输入ASR解码器,该模型减少了解码过程中的跨语言竞争,显著降低了英文-中文双语任务中的词错误率(WER)——尤其在英文识别方面效果显著,最佳配置相比基线模型将英文WER降低了1.04%。

ABSTRACT

Research on multilingual speech recognition remains attractive yet challenging. Recent studies focus on learning shared structures under the multi-task paradigm, in particular a feature sharing structure. This approach has been found effective to improve performance on each individual language. However, this approach is only useful when the deployed system supports just one language. In a true multilingual scenario where multiple languages are allowed, performance will be significantly reduced due to the competition among languages in the decoding space. This paper presents a multi-task recurrent model that involves a multilingual speech recognition (ASR) component and a language recognition (LR) component, and the ASR component is informed of the language information by the LR component, leading to a language-aware recognition. We tested the approach on an English-Chinese bilingual recognition task. The results show that the proposed multi-task recurrent model can improve performance of multilingual recognition systems.

研究动机与目标

  • 解决多语言ASR在解码过程中因跨语言竞争导致的性能下降问题。
  • 开发一种联合学习框架,使ASR与LR组件能够协同提升彼此性能。
  • 通过向ASR解码器提供实时语言信息,实现真正的多语言解码,降低对单语语言模型的依赖。
  • 通过共享跨语言的语音与语言共性建模,提升低资源语言的识别性能。
  • 在共享与统一语言建模设置下,评估循环多任务学习在双语(英文-中文)ASR设置中的有效性。

提出的方法

  • 设计了一种多任务循环LSTM架构,ASR与LR组件通过共享循环信息联合训练。
  • 将语言识别输出作为条件输入反馈至ASR解码器,使ASR模型在解码过程中具备语言感知能力。
  • 利用来自LR组件的循环反馈,逐帧优化语言身份估计,随时间推移提升解码置信度。
  • 该架构支持单语语言模型(mono-LM)与双语语言模型(bi-LM)的对比实验,解码通过加权有限状态转换器实现。
  • 探索了多种反馈配置,包括将循环状态输入至输入门、输出门及非线性激活函数。
  • 采用端到端反向传播进行联合训练,LR组件为ASR解码提供语言上下文以引导解码过程。

实验结果

研究问题

  • RQ1ASR与LR组件的联合训练是否能减少多语言解码过程中的跨语言竞争?
  • RQ2来自辅助LR组件的实时语言信息是否能在推理阶段提升ASR性能?
  • RQ3所提出的多任务循环模型与标准特征共享方法及单语基线系统相比,在双语ASR中表现如何?
  • RQ4在双语设置下,该模型在低资源语言(如中文)上的性能提升程度如何?
  • RQ5循环反馈的何种架构配置在联合ASR-LR训练中表现最佳?

主要发现

  • 与基线mono-LM系统相比,所提出的多任务循环模型将英文WER降低了1.04%,达到15.65%的最低WER,且在最优反馈配置下表现最佳。
  • 在多种配置下,英文WER均稳定提升0.4–0.5%,表明对架构变化具有鲁棒性。
  • 中文ASR性能仅获得微小提升(≤0.5%减少),表明受限于数据不匹配与信道差异,增益有限。
  • 表现最佳的配置为将循环信息同时反馈至输入门、输出门及激活函数,该配置在mono-LM设置下实现了最低WER(英文15.65%,中文23.82%)。
  • 该模型在训练数据上泛化能力良好,所有多任务配置在训练数据子集上均优于基线,表明其具备强大的学习能力并减少了过拟合风险。
  • bi-LM设置下的WER略高于mono-LM,但多任务模型仍优于基线,证明其在统一语言建模设置下依然有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。