Skip to main content
QUICK REVIEW

[论文解读] Improving LSTM-CTC based ASR performance in domains with limited training data

Jayadev Billa|arXiv (Cornell University)|Jul 3, 2017
Speech Recognition and Synthesis参考文献 19被引用 9
一句话总结

该论文通过结合最大扰动数据增强、堆叠/步进特征以及先进的正则化技术(NML与前向dropout),在低资源数据设置下提升了基于LSTM-CTC的自动语音识别(ASR)性能。所提方法在LibriSpeech 100小时数据集上将WER降低至7.37%,优于强基线的Kaldi混合DNN系统(WER为7.91%),有效弥合了低资源场景下的性能差距。

ABSTRACT

This paper addresses the observed performance gap between automatic speech recognition (ASR) systems based on Long Short Term Memory (LSTM) neural networks trained with the connectionist temporal classification (CTC) loss function and systems based on hybrid Deep Neural Networks (DNNs) trained with the cross entropy (CE) loss function on domains with limited data. We step through a number of experiments that show incremental improvements on a baseline EESEN toolkit based LSTM-CTC ASR system trained on the Librispeech 100hr (train-clean-100) corpus. Our results show that with effective combination of data augmentation and regularization, a LSTM-CTC based system can exceed the performance of a strong Kaldi based baseline trained on the same data.

研究动机与目标

  • 解决LSTM-CTC与混合DNN-CE ASR系统在低资源领域中的性能差距。
  • 提升LSTM-CTC ASR在LibriSpeech 100小时语料库上的表现,该语料库是低资源基准。
  • 证明数据增强与正则化技术可使端到端LSTM-CTC系统与复杂混合DNN系统具有竞争力。
  • 验证所提改进具有泛化能力,而非仅针对特定语料库,尽管资源有限。

提出的方法

  • 应用最大扰动技术,一种改进的数据增强方法,通过使用最大允许值对特征进行扰动,以提升训练数据的多样性。
  • 使用堆叠与步进的梅尔倒谱图特征(如3×3或5×5帧),以改善时间建模与上下文表征能力。
  • 采用NML(节点级最大池化)与前向dropout作为正则化技术,以防止循环层过拟合。
  • 在随机与级联配置中结合NML与前向dropout,以增强泛化能力与鲁棒性。
  • 使用EESEN工具包训练深层双向LSTM-CTC模型,采用CTC损失函数,并在验证集上以词准确率为优化目标。
  • 通过'newbob'方法实施学习率调度,当验证性能提升低于0.5%每轮时,将学习率减半。

实验结果

研究问题

  • RQ1像最大扰动这样的数据增强技术是否能在低资源设置下显著提升LSTM-CTC ASR性能?
  • RQ2将特征堆叠与步进结合是否能提升端到端ASR系统的识别准确率?
  • RQ3先进的dropout技术(NML与前向dropout)是否能优于标准dropout,以减少LSTM-CTC模型的过拟合?
  • RQ4多种正则化与增强策略的组合是否足以弥合LSTM-CTC与混合DNN-CE ASR系统之间的性能差距?
  • RQ5这些改进是否可泛化至LibriSpeech 100小时语料库之外,还是仅限于特定数据集?

主要发现

  • 最大扰动数据增强使WER相对基线降低6.6%,优于传统速度扰动方法。
  • 在随机配置中结合NML与前向dropout,使WER降至7.44%,相比单一dropout方法相对提升4.5%。
  • 级联dropout配置(NML-序列 → 前向-步进)达到最佳WER 7.37%,超越Kaldi基线混合DNN系统(7.91%)。
  • 最终的LSTM-CTC系统将WER从基线的11.81%降低至7.37%,消除了与Kaldi基线最初30–35%的WER差距。
  • 各项改进在多种配置下均表现稳健且一致,表明技术组合的协同效应优于单一方法。
  • 尽管计算资源有限,该方法在LibriSpeech 100小时基准上实现了最先进性能,表明其在低资源ASR中具有广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。