Skip to main content
QUICK REVIEW

[论文解读] Signal Combination for Language Identification

Shengye Wang, Li Wan|arXiv (Cornell University)|Oct 21, 2019
Speech Recognition and Synthesis参考文献 21被引用 10
一句话总结

本文提出了一种基于深度神经网络(DNN)的信号融合方法,通过融合多个识别器的声学特征、语言模型得分和置信度分数,提升多语言语音识别中的语言识别(LangID)准确率。DNN模型将错误率从基线的5.5%降低至4.3%,实现了21.8%的相对降低,优于基于词网的集成模型,并展现出更优的泛化能力,尤其在特征缺失的情况下表现更优。

ABSTRACT

Google's multilingual speech recognition system combines low-level acoustic signals with language-specific recognizer signals to better predict the language of an utterance. This paper presents our experience with different signal combination methods to improve overall language identification accuracy. We compare the performance of a lattice-based ensemble model and a deep neural network model to combine signals from recognizers with that of a baseline that only uses low-level acoustic signals. Experimental results show that the deep neural network model outperforms the lattice-based ensemble model, and it reduced the error rate from 5.5% in the baseline to 4.3%, which is a 21.8% relative reduction.

研究动机与目标

  • 通过结合除原始声学特征之外的多个来源的信号,提升多语言语音识别系统中的语言识别准确率。
  • 探究深度神经网络是否能在语言识别的信号融合中优于传统的基于词网的集成方法。
  • 评估缺失特征对信号融合中模型泛化能力和鲁棒性的影响。
  • 开发一种灵活且可训练的框架,整合识别器输出(声学模型代价、语言模型代价、置信度、熵、基于文本的语言识别)与声学语言识别得分。
  • 证明信号融合在降低端到端多语言语音识别中词错误率方面的有效性。

提出的方法

  • 通过配对语言候选者,将信号融合问题转化为二分类任务,并训练分类器以预测两个语言中哪一个更可能正确。
  • 分类器施加对称性约束:f(b,a) = 1 - f(a,b),确保语言对之间排名的一致性。
  • 输入特征包括声学语言识别得分、声学模型代价、语言模型代价、置信度得分、N-best假设的熵以及基于文本的语言识别得分。
  • 采用具有nabla形架构(12-128-64-32-16-8)的深度神经网络,激活函数为ReLU,使用批量归一化、50%的dropout以及He权重初始化进行分类。
  • 通过最小-最大缩放或对数变换将特征归一化至[-1,1]范围,以稳定训练过程。
  • 模型训练使用Adam优化器,配合学习率衰减,早停策略设定在5000万步,并对11个训练好的模型进行模型平均,以提升鲁棒性。

实验结果

研究问题

  • RQ1深度神经网络是否能在多识别器信号融合的语言识别任务中优于基于词网的集成模型?
  • RQ2识别器特征的有无(如缺失语言模型得分)如何影响模型的泛化能力和性能表现?
  • RQ3通过掩码特征进行数据增强是否能提升模型在未见数据上的鲁棒性和准确性?
  • RQ4信号融合对端到端多语言语音识别中词错误率的影响如何?
  • RQ5统一的、可训练的模型是否能有效整合多种识别器输出(声学、语言模型、置信度、熵、基于文本的语言识别)以提升语言识别准确率?

主要发现

  • 基于DNN的信号融合模型将语言识别错误率从基线的5.5%降低至4.3%,实现了21.8%的相对降低。
  • DNN模型优于基于词网的集成模型,后者将错误率从5.5%降低至4.5%(相对降低23.7%)。
  • 在‘both’数据子集(完整识别器特征)上,DNN模型错误率为2.0%,而词网模型为2.4%。
  • 在‘either’数据子集(部分特征)上,两种模型的错误率均为4.0%,表明对缺失特征具有鲁棒性。
  • 在端到端多语言语音识别中,DNN模型将词错误率从13.6%(基线)降低至12.8%,提升了0.8个百分点。
  • 使用增强数据(掩码特征)进行训练可提升泛化能力,在‘both’数据上的准确率高于未使用数据增强的训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。