Skip to main content
QUICK REVIEW

[论文解读] A Transformer with Interleaved Self-attention and Convolution for Hybrid Acoustic Models

Liang Lu|arXiv (Cornell University)|Oct 23, 2019
Speech Recognition and Synthesis参考文献 25被引用 4
一句话总结

本文提出一种混合声学模型,该模型在Transformer架构中交错使用自注意力与一维卷积层,显著提升了Librispeech数据集上的收敛速度与识别准确率。该模型在无需说话人自适应或数据增强的情况下,取得了与Kaldi的TDNN基线相当的性能,证明了在语音识别任务中,架构交错设计的有效性。

ABSTRACT

Transformer with self-attention has achieved great success in the area of nature language processing. Recently, there have been a few studies on transformer for end-to-end speech recognition, while its application for hybrid acoustic model is still very limited. In this paper, we revisit the transformer-based hybrid acoustic model, and propose a model structure with interleaved self-attention and 1D convolution, which is proven to have faster convergence and higher recognition accuracy. We also study several aspects of the transformer model, including the impact of the positional encoding feature, dropout regularization, as well as training with and without time restriction. We show competitive recognition results on the public Librispeech dataset when compared to the Kaldi baseline at both cross entropy training and sequence training stages. For reproducible research, we release our source code and recipe within the PyKaldi2 toolbox.

研究动机与目标

  • 探索基于Transformer的模型在混合声学建模中的应用,该框架相较于端到端方法研究较少。
  • 通过将卷积层与自注意力机制结合,解决混合模型中训练稳定性与长序列建模的挑战。
  • 研究位置编码、dropout正则化以及时间限制对混合设置下模型性能的影响。
  • 证明交错的注意力与卷积结构相较于纯自注意力模型,能提升收敛速度与识别准确率。
  • 通过PyKaldi2提供可复现的实现,支持未来在混合Transformer模型方向的研究。

提出的方法

  • 设计一种Transformer架构,其中在编码器堆栈中交替使用自注意力与一维卷积层,以平衡局部特征学习与长距离依赖建模。
  • 在每个子层(多头自注意力与前馈网络)后应用层归一化,并使用残差连接以稳定训练过程。
  • 使用正弦位置编码将序列顺序信息注入输入嵌入,使模型能够学习相对位置依赖关系。
  • 采用交叉熵(CE)与最大互信息(MMI)准则的序列训练联合优化,以提升对齐效果与泛化能力。
  • 通过将注意力上下文窗口限制为固定帧数,实现时间受限的自注意力机制,降低计算成本并提升训练稳定性。
  • 采用6层编码器,多头注意力机制(8头),模型维度d_model=256,前馈网络维度d_ff=1024,dropout率=0.1。

实验结果

研究问题

  • RQ1在Transformer编码器中交错使用自注意力与卷积层,对混合声学模型的收敛速度与识别准确率有何影响?
  • RQ2位置编码与dropout正则化对基于自注意力的混合模型性能有何影响?
  • RQ3与完整序列注意力相比,使用时间受限的自注意力是否能提升模型稳定性与识别性能?
  • RQ4纯Transformer-based的混合模型是否能在无需说话人级自适应或数据增强的情况下,达到与强基准Kaldi-TDNN相当的性能?
  • RQ5在MMI准则下的序列训练中,该模型表现如何?其在噪声测试集上是否具备良好的泛化能力?

主要发现

  • 交错使用自注意力与卷积的模型相比纯自注意力模型,实现了更快的收敛速度与更高的识别准确率。
  • 在Librispeech测试集(test-other)上,CE训练的Transformer模型取得了11.8%的WER,与Kaldi TDNN基线(CE为12.1%,sMBR为11.3%)相当。
  • 经过MMI序列训练后,Transformer模型在test-other上的WER降低至11.1%,优于Kaldi TDNN系统在相同划分上的表现(sMBR为11.3%)。
  • 尽管交叉熵损失降低,但将自注意力的未来上下文扩展超过有限窗口并未改善WER,表明可能存在过拟合或注意力头错位问题。
  • 时间受限注意力机制的模型性能略逊于完整注意力版本,但差异较小,表明局部上下文已足够支持优异性能。
  • 该模型在未使用i-vector自适应或速度扰动的情况下取得了具有竞争力的结果,凸显了所提架构的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。