Skip to main content
QUICK REVIEW

[论文解读] Sequence-to-Sequence Speech Recognition with Time-Depth Separable Convolutions

Awni Hannun, Ann Lee|arXiv (Cornell University)|Apr 4, 2019
Speech Recognition and Synthesis被引用 4
一句话总结

该论文提出了一种使用时间-深度可分离(TDS)卷积的全卷积序列到序列语音识别模型,在LibriSpeech数据集上实现了最先进(SOTA)的词错误率(WER),同时比RNN基线模型快10倍以上。TDS模块将时间维度和通道维度的聚合解耦,使模型在参数量极少的情况下实现大感受野,结合使用卷积语言模型的稳定束搜索进一步提升了准确率,在噪声LibriSpeech数据集上相比之前的序列到序列模型将WER降低了22%以上。

ABSTRACT

We propose a fully convolutional sequence-to-sequence encoder architecture with a simple and efficient decoder. Our model improves WER on LibriSpeech while being an order of magnitude more efficient than a strong RNN baseline. Key to our approach is a time-depth separable convolution block which dramatically reduces the number of parameters in the model while keeping the receptive field large. We also give a stable and efficient beam search inference procedure which allows us to effectively integrate a language model. Coupled with a convolutional language model, our time-depth separable convolution architecture improves by more than 22% relative WER over the best previously reported sequence-to-sequence results on the noisy LibriSpeech test set.

研究动机与目标

  • 开发一种高效且准确的序列到序列语音识别模型,超越强大的RNN基线模型。
  • 通过用使用时间-深度可分离卷积的全卷积编码器替代循环层,降低模型复杂度和推理时间。
  • 设计一种稳定且可扩展的束搜索推理机制,有效整合卷积语言模型,且在大束尺寸下不降低准确率。
  • 消除低效的顺序组件(如调度采样和基于位置的注意力),同时保持或提升识别性能。

提出的方法

  • 编码器使用时间-深度可分离(TDS)卷积模块,首先对时间维度应用大小为k×1的2D卷积,随后通过两个1×1卷积和ReLU激活的全连接块。
  • TDS模块包含残差连接,并在所有维度(包括时间)上应用层归一化,以稳定训练并提升泛化能力。
  • 模型采用三层子采样层,步长为2,逐步增加通道数,以压缩时间信息同时保持上下文。
  • 解码器在训练时使用教师强制策略,采用简化的内积注意力机制,支持并行计算,替代计算成本较高的神经注意力。
  • 开发了一种稳定的束搜索过程,即使在束大小达到80时仍能保持高准确率,从而有效整合卷积语言模型。
  • 在推理阶段集成卷积语言模型以提升n-gram基线性能,束搜索能高效处理语言模型约束。

实验结果

研究问题

  • RQ1使用时间-深度可分离卷积的全卷积编码器是否能在显著提升效率的同时,实现比RNN基线更优的WER?
  • RQ2移除如调度采样和基于位置的注意力等顺序依赖关系是否会降低性能?更简单的替代方案能否保持准确率?
  • RQ3能否设计一种稳定的束搜索过程,使其在集成卷积语言模型时能有效扩展至大束尺寸?
  • RQ4感受野大小如何影响WER?可靠序列到序列识别的最小阈值是多少?
  • RQ5当与高效束搜索和TDS编码器结合时,卷积语言模型在多大程度上能改善WER?

主要发现

  • TDS卷积模型在LibriSpeech开发集-clean上达到5.10%的WER,在dev-other上达到14.99%,优于此前报告的最佳序列到序列结果。
  • 在噪声LibriSpeech测试集上,相比之前的序列到序列模型,该模型将WER相对降低超过22%,达到最先进性能。
  • 在LibriSpeech上训练一个epoch仅需7分钟,相比具有相同子采样因子的RNN基线,训练速度提升10倍以上。
  • 使用束大小为80的束搜索时,结合卷积语言模型,准确率保持稳定并持续提升,尤其在dev-other集上表现显著。
  • 当感受野低于某一阈值时,模型的WER急剧下降,表明充分的上下文信息对解码查询的消歧至关重要。
  • 未使用调度采样和基于位置的注意力并未损害性能,模型通过更简单、更高效的替代方案取得了优异结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。