Skip to main content
QUICK REVIEW

[论文解读] Improving Noise Robustness of an End-to-End Neural Model for Automatic Speech Recognition

Jagadeesh Balam, Jocelyn Huang|arXiv (Cornell University)|Oct 23, 2020
Speech Recognition and Synthesis参考文献 23被引用 5
一句话总结

本文提出通过使用密集数据增强(包括混响、背景噪声和低比特率编解码器)对预训练的端到端自动语音识别(ASR)模型进行微调,以提升噪声鲁棒性,同时不降低纯净语音的性能。该方法在各种噪声环境下(包括远场、混合采样率和低比特率编解码器)均实现了显著的词错误率(WER)降低,并在NeMo中开源了模型和训练方案。

ABSTRACT

We present our experiments in training robust to noise an end-to-end automatic speech recognition (ASR) model using intensive data augmentation. We explore the efficacy of fine-tuning a pre-trained model to improve noise robustness, and we find it to be a very efficient way to train for various noisy conditions, especially when the conditions in which the model will be used, are unknown. Starting with a model trained on clean data helps establish baseline performance on clean speech. We carefully fine-tune this model to both maintain the performance on clean speech, and improve the model accuracy in noisy conditions. With this schema, we trained robust to noise English and Mandarin ASR models on large public corpora. All described models and training recipes are open sourced in NeMo, a toolkit for conversational AI.

研究动机与目标

  • 开发一种在多种真实声学条件下具有良好泛化能力的噪声鲁棒型端到端ASR模型。
  • 在提升低信噪比(SNR)和低比特率条件下性能的同时,保持对纯净语音的高精度。
  • 证明在线数据增强的微调是一种高效且可扩展的提升噪声鲁棒性的方法。
  • 为英语和普通话提供基于公开数据集训练的开源大规模ASR模型。

提出的方法

  • 在大规模纯净语音数据集(包括LibriSpeech、Common Voice、WSJ、Fisher、Switchboard和AISHELL-2)上预训练一个端到端ASR模型(QuartzNet)。
  • 使用在线数据增强对预训练模型进行微调,采用随机概率 $ P_{aug} $,在不同信噪比(SNR)下应用混响、前景噪声和背景噪声。
  • 通过在低比特率(如4.75–7.4 kbps的AMR-NB和25–48 kbps的Ogg Vorbis)下应用编解码器增强,模拟电话通信和带宽限制。
  • 在微调过程中,使用来自OpenSLR和BUT ReverbDB的真实与模拟房间脉冲响应(RIR)来建模远场声学特性。
  • 通过超参数控制增强强度:$ P_{rir} $ 控制RIR应用概率,SNR范围(前景噪声为0–30 dB,背景噪声为10–40 dB)。
  • 将 $ P_{aug} $ 设定为0.3至0.5之间为最优,以在纯净语音性能与噪声鲁棒性之间取得平衡。

实验结果

研究问题

  • RQ1通过密集数据增强进行微调,是否能在不降低纯净语音性能的前提下,提升端到端ASR在多样化噪声条件下的鲁棒性?
  • RQ2增强概率 $ P_{aug} $ 的选择如何影响纯净语音与噪声语音识别准确率之间的权衡?
  • RQ3一个经过多样化增强微调的单一模型,是否能有效泛化到远场、混合采样率和低比特率编解码器场景?
  • RQ4当在VOiCES语料库中的真实世界噪声源上进行测试时,该模型的性能保持程度如何?

主要发现

  • 与基础模型相比,噪声鲁棒模型(QN-En-NR)在D105远场测试集上实现了66%的相对WER降低,而纯净语音测试集的WER仅上升3.1%。
  • 在 $ P_{aug} = 0.3 $ 时,模型在LibriSpeech测试纯净集上的WER保持在3.86%,同时在噪声条件下的WER相比基础模型最高降低了40%。
  • 对于8 kHz音频,经过混合采样率增强微调后,普通话模型的WER从12.35%降至7.48%,表明其对带宽减少具有极强的鲁棒性。
  • 在低信噪比条件下,噪声鲁棒模型表现出一致的性能提升:在8 kHz噪声环境下,Hub5 SWB测试中,使用4.75 kbps AMR-NB编解码器时,WER从14.0%降至13.1%。
  • 在LibriSpeech测试纯净集上,使用VOiCES噪声且SNR为0 dB时,噪声鲁棒模型的WER为4.56%,而基础模型为4.96%,表明其在低信噪比下具有更强的鲁棒性。
  • 在 $ P_{aug} = 1 $ 下训练的模型在测试纯净集上WER急剧上升至72.91%,证实过度增强会损害纯净语音性能,最优 $ P_{aug} $ 约为0.3–0.5。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。