Skip to main content
QUICK REVIEW

[论文解读] Improving sequence-to-sequence speech recognition training with on-the-fly data augmentation

Thai‐Son Nguyen, Sebastian Stueker|arXiv (Cornell University)|Oct 29, 2019
Speech Recognition and Synthesis被引用 5
一句话总结

本文提出了一种实时数据增强技术——频域时间拉伸、SpecAugment 和子序列采样,以提升序列到序列(S2S)语音识别模型的性能。通过在训练过程中应用这些方法,作者在不使用外部语言模型的情况下,实现了 Switchboard 数据集上 5.2% 和 Callhome 数据集上 10.2% 的最先进词错误率(WER),显著降低了基于 LSTM 和自注意力机制的 S2S 架构中的过拟合现象。

ABSTRACT

Sequence-to-Sequence (S2S) models recently started to show state-of-the-art performance for automatic speech recognition (ASR). With these large and deep models overfitting remains the largest problem, outweighing performance improvements that can be obtained from better architectures. One solution to the overfitting problem is increasing the amount of available training data and the variety exhibited by the training data with the help of data augmentation. In this paper we examine the influence of three data augmentation methods on the performance of two S2S model architectures. One of the data augmentation method comes from literature, while two other methods are our own development - a time perturbation in the frequency domain and sub-sequence sampling. Our experiments on Switchboard and Fisher data show state-of-the-art performance for S2S models that are trained solely on the speech training data and do not use additional text data.

研究动机与目标

  • 为解决尽管架构取得进展,大型序列到序列(S2S)语音识别模型中仍存在的过拟合问题,该问题仍是性能的主要瓶颈。
  • 探究实时数据增强技术在提升 S2S 模型在标准自动语音识别(ASR)基准上泛化能力和鲁棒性方面的有效性。
  • 比较不同增强策略——时间拉伸、SpecAugment 和子序列采样——对基于 LSTM 和自注意力机制的 S2S 架构的影响。
  • 仅使用语音训练数据,在不依赖外部文本数据或语言建模的情况下,实现 Switchboard 和 Callhome 数据集上的最先进性能。

提出的方法

  • 通过窗口化特征序列并对每个窗口使用从均匀分布中随机采样的拉伸因子进行最近邻插值重采样,对对数梅尔倒谱特征实施动态时间拉伸。
  • 通过频率掩码(随机掩码 f 个连续的频带通道)和时间掩码(掩码 t 个连续的时间步)实现 SpecAugment,每个语音样本应用 T 次,T 值根据模型架构进行调优。
  • 子序列采样通过从完整真实转录中随机采样子序列来生成目标转录,用于训练解码器以处理部分或可变长度输出。
  • 所有增强技术均在训练过程中实时应用,实现高效计算并实现与模型的联合优化。
  • LSTM 模型使用 dropout 和随机深度正则化,而自注意力模型则使用 dropout 和随机层归一化,以进一步缓解过拟合。
  • 实验在 Switchboard(SWB)和 Fisher 数据集上进行,包括对增强组合的消融研究以及超参数调优(如 T、窗口大小)。

实验结果

研究问题

  • RQ1实时数据增强技术如何影响序列到序列语音识别模型的泛化能力和鲁棒性?
  • RQ2时间拉伸、SpecAugment 和子序列采样对 S2S 模型 WER 降低的相对贡献是什么?
  • RQ3基于 LSTM 和自注意力机制的 S2S 架构在对不同数据增强策略的敏感性上存在哪些差异?
  • RQ4仅通过有效的数据增强是否足以在不使用外部语言模型或文本数据的情况下实现最先进性能?
  • RQ5哪些超参数设置(如掩码应用次数 T)能在不同模型架构上实现最优性能?

主要发现

  • 时间拉伸与 SpecAugment 的结合使基于 LSTM 的模型在 Switchboard(Hub5’00)上的 WER 降低至 13.5%,自注意力模型则降至 13.4%,优于单一方法。
  • 当与时间拉伸和 SpecAugment 结合时,子序列采样使自注意力模型在 Switchboard 上的 WER 进一步降低至 13.0%,但导致基于 LSTM 的模型性能下降,表明两者存在不同的过拟合行为。
  • 使用固定的子序列集合可使基于 LSTM 的模型 WER 降低至 13.0%,同时在自注意力模型上保持竞争力,表明静态子序列对循环架构更稳定。
  • 在完整的 2,000 小时 Switchboard+Fisher 训练集上,基于 LSTM 和自注意力模型的集成在 Switchboard 上实现了 5.2% 的 WER,在 Callhome 上实现了 10.2% 的 WER,无需外部语言模型即可达到或超越先前最先进结果。
  • 自注意力模型需要比 LSTM 模型(100k 次更新)更多的训练更新次数(250k 次)才能收敛,表明在相同增强策略下其优化动态存在差异。
  • 最优配置中,LSTM 模型使用 T=2,自注意力模型使用 T=1,且窗口大小 w 设为无穷大(即整个序列),以实现最佳性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。