Skip to main content
QUICK REVIEW

[论文解读] Joint CTC-Attention based End-to-End Speech Recognition using Multi-task Learning

Suyoun Kim, Takaaki Hori|arXiv (Cornell University)|Sep 21, 2016
Speech Recognition and Synthesis参考文献 12被引用 18
一句话总结

该论文提出了一种多任务学习框架,通过共享编码器联合训练基于CTC和注意力机制的端到端自动语音识别(ASR)模型,提升了对齐的鲁棒性与收敛速度。通过结合CTC的从左到右单调对齐约束与注意力机制的上下文感知解码,该方法在WSJ和CHiME-4数据集上相较CTC和注意力基线模型实现了5.4%–14.6%的相对词错误率(CER)降低,且在噪声和干净环境下均实现了更快的学习速度与更好的泛化能力。

ABSTRACT

Recently, there has been an increasing interest in end-to-end speech recognition that directly transcribes speech to text without any predefined alignments. One approach is the attention-based encoder-decoder framework that learns a mapping between variable-length input and output sequences in one step using a purely data-driven method. The attention model has often been shown to improve the performance over another end-to-end approach, the Connectionist Temporal Classification (CTC), mainly because it explicitly uses the history of the target character without any conditional independence assumptions. However, we observed that the performance of the attention has shown poor results in noisy condition and is hard to learn in the initial training stage with long input sequences. This is because the attention model is too flexible to predict proper alignments in such cases due to the lack of left-to-right constraints as used in CTC. This paper presents a novel method for end-to-end speech recognition to improve robustness and achieve fast convergence by using a joint CTC-attention model within the multi-task learning framework, thereby mitigating the alignment issue. An experiment on the WSJ and CHiME-4 tasks demonstrates its advantages over both the CTC and attention-based encoder-decoder baselines, showing 5.4-14.6% relative improvements in Character Error Rate (CER).

研究动机与目标

  • 解决注意力机制端到端ASR在噪声环境和长序列下的不稳定与收敛缓慢问题。
  • 克服纯注意力模型缺乏从左到右对齐约束的问题,该问题会导致对齐错误与泛化能力差。
  • 通过在多任务学习框架中利用CTC的单调对齐特性,提升训练稳定性和收敛速度。
  • 在无需外部语言模型的前提下,提升在干净数据(WSJ)和噪声数据(CHiME-4)语音识别任务中的性能。
  • 证明即使在干净数据场景下,CTC的辅助目标也能提升泛化能力。

提出的方法

  • 使用多任务学习,同时训练共享编码器的CTC和基于注意力的解码器目标函数。
  • 采用CTC损失与注意力损失的加权组合,其中超参数λ控制两个目标之间的平衡。
  • 通过前向-后向算法应用CTC损失,以在编码器输出中强制实现单调、从左到右的对齐。
  • 在解码器中使用基于位置的注意力机制,根据先前的解码输出关注编码器状态。
  • 采用4层双向LSTM编码器和1层LSTM解码器实现模型,层间加入线性投影与残差连接。
  • 使用AdaDelta进行优化,配合梯度裁剪与均匀权重初始化,并采用带长度归一化的束搜索进行解码。

实验结果

研究问题

  • RQ1联合训练CTC与注意力是否能提升在噪声语音识别中的对齐鲁棒性?
  • RQ2在端到端ASR中引入CTC的单调对齐约束是否能加速收敛?
  • RQ3与独立的CTC和注意力模型相比,该多任务学习框架在干净与噪声数据集上的表现如何?
  • RQ4为最大化ASR性能,CTC与注意力损失之间的最优平衡是什么?
  • RQ5尽管CTC未建模字符依赖关系,其目标是否仍能提升干净数据设置下的泛化能力?

主要发现

  • 联合CTC-attention模型在WSJ和CHiME-4数据集上相较CTC与注意力基线模型实现了5.4%–14.6%的相对CER改进。
  • 当λ = 0.2时,模型在WSJ与CHiME-4上均取得最佳性能,表明CTC与注意力目标之间达到了最优平衡。
  • 学习曲线显示,MTL模型比纯注意力模型更早达到更高的字符准确率,收敛速度更快。
  • 注意力对齐的可视化显示,MTL模型在第5个训练周期时已学习到正确的单调对齐,而注意力模型在第9个周期仍未收敛。
  • CTC损失有效引导注意力机制实现单调对齐,减少了训练初期的对齐错误。
  • 即使在干净的WSJ数据上,MTL模型也优于两个基线模型,表明CTC的归纳偏置有助于提升泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。