Skip to main content
QUICK REVIEW

[论文解读] Training Augmentation with Adversarial Examples for Robust Speech Recognition

Sining Sun, Ching-Feng Yeh|arXiv (Cornell University)|Jun 7, 2018
Speech Recognition and Synthesis被引用 14
一句话总结

本文提出使用快速梯度符号法(FGSM)进行对抗性数据增强,以提升语音识别中深度神经网络声学模型的鲁棒性。通过在训练过程中基于模型参数动态生成对抗性样本,该方法在Aurora-4上实现了23%的相对词错误率降低,在CHiME-4上实现了5–6%的性能提升,且与教师-学生训练结合后进一步改善了性能。

ABSTRACT

This paper explores the use of adversarial examples in training speech recognition systems to increase robustness of deep neural network acoustic models. During training, the fast gradient sign method is used to generate adversarial examples augmenting the original training data. Different from conventional data augmentation based on data transformations, the examples are dynamically generated based on current acoustic model parameters. We assess the impact of adversarial data augmentation in experiments on the Aurora-4 and CHiME-4 single-channel tasks, showing improved robustness against noise and channel variation. Further improvement is obtained when combining adversarial examples with teacher/student training, leading to a 23% relative word error rate reduction on Aurora-4.

研究动机与目标

  • 提升深度神经网络声学模型在噪声和信道失真环境下的鲁棒性。
  • 探究动态生成的对抗性样本是否能够增强训练数据的多样性并提升模型泛化能力。
  • 评估对抗性数据增强与教师-学生训练结合在提升自动语音识别性能方面的有效性。
  • 将对抗性数据增强与随机扰动作为数据增强策略进行比较。

提出的方法

  • 在训练过程中使用快速梯度符号法(FGSM)生成对抗性样本,该方法基于损失函数对输入的梯度计算扰动。
  • 对于每个小批量样本,通过在输入梯度符号方向上添加一个微小的、有目标的扰动,并按超参数ε进行缩放来生成对抗性样本。
  • 模型在原始样本和对抗性样本上进行联合训练,从而有效提升训练数据的多样性,并增强对输入扰动的鲁棒性。
  • 该方法与教师-学生(T/S)训练相结合,其中学生模型通过结合自身预测与教师模型在干净数据上生成的软目标进行训练。
  • 损失函数包含学生输出的交叉熵项以及利用教师输出的蒸馏项,其中超参数α用于控制两者的平衡。
  • 该方法在Aurora-4和CHiME-4数据集上进行评估,采用标准WER指标对真实和模拟噪声测试集进行测试。

实验结果

研究问题

  • RQ1在训练过程中通过FGSM生成的对抗性样本是否能够提升声学模型对噪声和信道变化的鲁棒性?
  • RQ2与基于随机扰动的数据增强相比,对抗性数据增强在WER降低方面表现如何?
  • RQ3将对抗性数据增强与教师-学生训练结合是否能带来模型鲁棒性的叠加提升?
  • RQ4在语音识别任务中,对抗性数据增强的最优扰动幅度ε是多少?

主要发现

  • 在Aurora-4数据集上,仅使用对抗性数据增强即实现了14.1%的相对词错误率降低,当同时存在噪声和信道失真时,最高提升达18.6%。
  • 在CHiME-4单轨任务中,该方法在真实测试集(et05_real)上实现了5.7%的相对WER降低,在模拟测试集(et05_simu)上实现了5.3%的降低。
  • 在Aurora-4上将对抗性数据增强与教师-学生训练结合,实现了23%的相对WER降低,最终WER降至8.50%。
  • 与仅使用教师-学生训练(WER为9.70%)相比,基于随机扰动的增强方法仅带来微小提升(WER为9.48%),凸显了对抗性样本的优越性。
  • 该方法在不同噪声类型和环境条件下均表现出一致的性能增益,最优性能分别在Aurora-4上对应ε=0.3,CHiME-4上对应ε<0.25。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。