Skip to main content
QUICK REVIEW

[论文解读] An improved hybrid CTC-Attention model for speech recognition

Zhe Yuan, Zhuoran Lyu|arXiv (Cornell University)|Oct 29, 2018
Speech Recognition and Synthesis参考文献 13被引用 11
一句话总结

该论文提出了一种改进的混合 CTC-attention 端到端自动语音识别模型,采用更深的编码器、BiLSTM 增强的 CTC 解码器以及注意力平滑技术,在 LibriSpeech 测试集-clean 子集上实现了 4.43%(无语言模型)和 3.34%(使用 RNN-LM)的最先进词错误率。

ABSTRACT

Recently, end-to-end speech recognition with a hybrid model consisting of the connectionist temporal classification(CTC) and the attention encoder-decoder achieved state-of-the-art results. In this paper, we propose a novel CTC decoder structure based on the experiments we conducted and explore the relation between decoding performance and the depth of encoder. We also apply attention smoothing mechanism to acquire more context information for subword-based decoding. Taken together, these strategies allow us to achieve a word error rate(WER) of 4.43% without LM and 3.34% with RNN-LM on the test-clean subset of the LibriSpeech corpora, which by far are the best reported WERs for end-to-end ASR systems on this dataset.

研究动机与目标

  • 通过更有效地整合 CTC 和注意力机制,提升端到端语音识别的鲁棒性和收敛速度。
  • 解决纯注意力模型在噪声环境下性能不佳以及训练过程中对齐错误的问题。
  • 通过架构改进和优化技术,降低 LibriSpeech 基准测试中的词错误率(WER)。
  • 探究编码器深度以及 CTC 解码分支中额外的 BiLSTM 层对性能的影响。
  • 评估注意力平滑和 L2 正则化在提升子词级解码中上下文建模能力方面的有效性。

提出的方法

  • 提出一种混合 CTC-attention 架构,采用共享编码器,包含 4 层卷积神经网络(CNN)后接 7 层双向长短期记忆网络(BiLSTM),每方向 1024 个单元。
  • 在 CTC 解码分支中引入一个 BiLSTM 层,以改善对齐学习并降低 WER。
  • 应用注意力平滑技术以增强上下文建模能力,并在解码过程中提升泛化性能。
  • 使用加权损失函数,结合 CTC 和注意力损失,其中超参数 α 经调优后确定为 0.1,以实现最佳性能。
  • 通过字节对编码(BPE)使用子词单元,共 5000 个单元,以缓解 OOV(未登录词)问题。
  • 通过 3 倍速度扰动(0.9x、1.0x、1.1x)进行数据增强,并使用 KALDI 工具提取 80 维梅尔滤波器组特征。

实验结果

研究问题

  • RQ1增加编码器深度对混合 CTC-attention 模型性能有何影响?
  • RQ2在 CTC 解码分支中增加 BiLSTM 层对词错误率有何影响?
  • RQ3注意力平滑如何提升子词级端到端自动语音识别中的解码性能?
  • RQ4在 LibriSpeech 上最小化 WER 时,CTC 与注意力损失之间的最优平衡(α)是什么?
  • RQ5所提出的模型是否能在不使用外部语言模型的情况下实现在 LibriSpeech 上的最先进性能?

主要发现

  • 该模型在无语言模型的 LibriSpeech 测试集-clean 子集上实现了 4.43% 的词错误率(WER),创下新的最先进水平。
  • 在使用 RNN-LM 的情况下,该模型在测试集-clean 子集上实现了 3.34% 的 WER,同样是端到端系统中的新最先进水平。
  • 在 RNN-LM 的设置下,向 CTC 解码分支添加 BiLSTM 层可使 WER 降低约 25%。
  • 将编码器中 BiLSTM 层的数量从 5 层增加到 7 层可提升 WER 表现,最佳结果出现在 7 层编码器加 CTC-BiLSTM 的配置下。
  • 最优损失权重 α 为 0.1,表明 CTC 损失应作为辅助项,仅占较小比例以协助注意力解码。
  • 该模型在测试集-clean 和测试集-other 子集上均优于先前的端到端系统,如 DeepSpeech2、ESPnet 和 I-Attention。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。