Skip to main content
QUICK REVIEW

[论文解读] End-to-end attention-based distant speech recognition with Highway LSTM

Hassan Taherian|arXiv (Cornell University)|Oct 17, 2016
Speech Recognition and Synthesis参考文献 12被引用 3
一句话总结

本文提出了一种端到端的基于注意力机制的语音识别系统,用于远距离语音识别,采用多通道音频输入和高速长短期记忆(HLSTM)网络。通过整合注意力机制与加权有限状态转换器(WFST)语言模型,该模型在AMI远距离语音识别基准上实现了更高的鲁棒性和性能,通过更深的、梯度消失抗性更强的网络结构,超越了先前的方法。

ABSTRACT

End-to-end attention-based models have been shown to be competitive alternatives to conventional DNN-HMM models in the Speech Recognition Systems. In this paper, we extend existing end-to-end attention-based models that can be applied for Distant Speech Recognition (DSR) task. Specifically, we propose an end-to-end attention-based speech recognizer with multichannel input that performs sequence prediction directly at the character level. To gain a better performance, we also incorporate Highway long short-term memory (HLSTM) which outperforms previous models on AMI distant speech recognition task.

研究动机与目标

  • 开发一种专为远距离语音识别(DSR)设计的端到端语音识别系统,其中混响和重叠信号会降低性能。
  • 将现有的基于注意力机制的循环序列生成器(ARSG)扩展至直接处理多通道音频输入,避免依赖波束成形等前端预处理。
  • 通过引入高速LSTM(HLSTM)来缓解堆叠RNN中的梯度消失问题,从而提升模型深度和训练稳定性。
  • 通过WFST框架将语言模型集成到ARSG解码器中,以降低词错误率(WER),同时不损害训练的可操作性。

提出的方法

  • 模型使用由N个音频流组成的多通道输入X,这些音频流被拼接后输入双向高速LSTM(BHLSTM)编码器,以学习深层上下文表征。
  • 注意力机制通过基于上下文的评分函数(使用查询、键和上下文向量)计算解码器状态与编码器隐藏状态hi之间的对齐权重αi,l。
  • 上下文向量ci通过使用注意力权重αi,l对编码器状态进行加权求和来计算,以聚焦于相关输入帧。
  • 解码器为单向LSTM,按顺序逐个生成输出字符,条件依赖于前一个字符、解码器隐藏状态和上下文向量。
  • 采用WFST框架将语言模型集成到解码过程中,通过可调超参数β对声学模型和语言模型得分进行加权求和。
  • 整个模型通过最大化真实转录的对数似然进行端到端训练,并采用调度采样策略以提升推理阶段的鲁棒性。

实验结果

研究问题

  • RQ1基于注意力机制的端到端模型是否能在不使用前端波束成形的情况下,通过多通道输入在远距离语音识别中超越传统的DNN-HMM系统?
  • RQ2在远距离语音识别的深层RNN架构中,高速LSTM的集成在多大程度上提升了训练稳定性和性能?
  • RQ3通过WFST框架集成语言模型在端到端自动语音识别中,能在多大程度上降低词错误率?
  • RQ4在编码前将多通道输入拼接,是否比对各通道分别处理并使用通道特定注意力机制的性能更优?
  • RQ5注意力机制是否能在噪声大、混响强的环境中有效聚焦于多通道中的相关输入帧?

主要发现

  • 所提出的端到端模型结合多通道输入与BHLSTM编码器,在AMI远距离语音识别基准上实现了最先进性能,利用更深的网络结构而避免了梯度消失问题。
  • 使用高速LSTM使得深层RNN架构的训练更加稳定,相比标准LSTM,编码器的表征学习能力得到显著提升。
  • 通过WFST框架集成语言模型显著降低了词错误率(WER),证明了语言建模在端到端ASR中的重要性。
  • 该模型在具有挑战性的声学条件下,优于先前依赖单通道输入或传统DNN-HMM系统的注意力基模型。
  • 将多通道输入与注意力机制及HLSTM结合,实现了无需事先知晓麦克风阵列几何结构的鲁棒、实时推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。