Skip to main content
QUICK REVIEW

[论文解读] Frustratingly Easy Noise-aware Training of Acoustic Models

Desh Raj, Jesús Villalba|arXiv (Cornell University)|Nov 4, 2020
Speech Recognition and Synthesis参考文献 28被引用 4
一句话总结

该论文提出了一种简单而有效的噪声感知训练方法,通过使用从语音和静音帧均值得出的语音级噪声向量,利用现有的GMM-HMM对齐结果,无需额外计算。该方法在AMI和Aurora-4数据集上实现了6–7%的相对WER提升,优于先前基于嵌入的基线方法,并通过帧级最大似然估计实现了在线流式ASR。

ABSTRACT

Environmental noises and reverberation have a detrimental effect on the performance of automatic speech recognition (ASR) systems. Multi-condition training of neural network-based acoustic models is used to deal with this problem, but it requires many-folds data augmentation, resulting in increased training time. In this paper, we propose utterance-level noise vectors for noise-aware training of acoustic models in hybrid ASR. Our noise vectors are obtained by combining the means of speech frames and silence frames in the utterance, where the speech/silence labels may be obtained from a GMM-HMM model trained for ASR alignments, such that no extra computation is required beyond averaging of feature vectors. We show through experiments on AMI and Aurora-4 that this simple adaptation technique can result in 6-7% relative WER improvement. We implement several embedding-based adaptation baselines proposed in literature, and show that our method outperforms them on both the datasets. Finally, we extend our method to the online ASR setting by using frame-level maximum likelihood for the mean estimation.

研究动机与目标

  • 在不增加训练复杂度的前提下,提升DNN-based语音模型在噪声环境下的鲁棒性。
  • 开发一种低成本、高效的噪声感知训练技术,复用现有的GMM-HMM对齐结果实现语音活动检测。
  • 通过基于帧级最大似然估计实时估算噪声向量,实现在线流式ASR。
  • 在噪声鲁棒性语音识别中,超越现有的基于嵌入的自适应方法(如i-vector和e-vector)。

提出的方法

  • 利用预训练GMM-HMM对齐结果中的语音活动检测(SAD)标签,计算每个语音样本中语音帧和静音帧的均值,得到噪声向量。
  • 将这些噪声向量拼接到输入特征中,使DNN能够学习非线性变换以增强对噪声的鲁棒性。
  • 对于在线ASR,通过在流式帧上使用最大似然估计的概率模型,实时估计噪声向量的均值。
  • 通过EM优化学习语音和噪声分量的缩放因子,当无帧被观测时,使用全局统计量或默认值进行初始化。
  • 该方法避免前端信号处理,而是通过结构化的输入条件化,将噪声感知能力直接嵌入语音模型。
  • 该方法与序列判别性训练准则(如无图 lattice-free MMI)兼容,使用与语音模型训练相同的对齐结果。

实验结果

研究问题

  • RQ1能否通过从语音和静音帧均值得到的简单、计算轻量级噪声向量,提升语音模型的鲁棒性?
  • RQ2该噪声感知训练方法是否优于现有的基于嵌入的自适应方法(如i-vector和e-vector)?
  • RQ3噪声向量估计是否可适应在线流式ASR,而无需等待完整语音段结束?
  • RQ4该方法的性能与采用大量数据增强的多条件训练相比如何?

主要发现

  • 与基线模型相比,该方法在AMI和Aurora-4数据集上实现了6–7%的相对WER提升。
  • 该方法在噪声鲁棒性语音识别中优于i-vector和e-vector等成熟基线方法,展现出对环境失真更强的泛化能力。
  • 利用语音和静音帧均值的噪声向量估计,相比仅使用起始/结束帧的方法,提供了更具信息量的噪声表征。
  • 采用帧级最大似然估计的在线自适应版本,实现了低延迟的实时噪声感知推理。
  • 该方法在标准GMM-HMM对齐之外不引入额外计算开销,适用于大规模部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。