Skip to main content
QUICK REVIEW

[论文解读] Streaming ResLSTM with Causal Mean Aggregation for Device-Directed Utterance Detection

Xiaosu Tong, Che-Wei Huang|arXiv (Cornell University)|Jul 17, 2020
Speech and Audio Processing参考文献 15被引用 4
一句话总结

本文提出一种带有因果均值聚合的流式ResLSTM模型,用于实时设备导向语音检测,实现在在线推理过程中实现早期且准确的预测。与先前模型相比,该方法在等错误率(EER)上实现了41%的相对降低,尤其在早期决策场景下优于基于注意力的模型。

ABSTRACT

In this paper, we propose a streaming model to distinguish voice queries intended for a smart-home device from background speech. The proposed model consists of multiple CNN layers with residual connections, followed by a stacked LSTM architecture. The streaming capability is achieved by using unidirectional LSTM layers and a causal mean aggregation layer to form the final utterance-level prediction up to the current frame. In order to avoid redundant computation during online streaming inference, we use a caching mechanism for every convolution operation. Experimental results on a device-directed vs. non device-directed task show that the proposed model yields an equal error rate reduction of 41% compared to our previous best model on this task. Furthermore, we show that the proposed model is able to accurately predict earlier in time compared to the attention-based models.

研究动机与目标

  • 开发一种支持流式在线推理的模型,用于实时区分设备导向(DD)与非设备导向(ND)语音。
  • 在语音结束时间点可变或未知的流式场景中,提升早期预测的准确性。
  • 通过卷积层缓存避免冗余计算,降低在线推理中的计算开销。
  • 在流式环境下,评估并比较将帧级嵌入转换为话语级预测的聚合方法。
  • 证明因果均值聚合在需要早期决策时优于注意力机制,同时不牺牲话语结束时的性能。

提出的方法

  • 采用包含六个残差块、批归一化和单向LSTM的深度ResLSTM架构,以提取分层声学特征。
  • 对帧级LSTM输出($h_t$)应用因果均值聚合,生成流式、时间有序的话语级预测。
  • 对所有卷积操作使用缓存机制,以消除在线推理中的冗余计算。
  • 在训练中应用帧级反向传播,并重复使用话语级标签,以支持流式学习。
  • 将因果均值聚合与注意力、全局均值及基于RNN的聚合方法在$h_t$和$y_t$(预测logits)上进行比较。
  • 实现一种因果注意力变体,通过掩码屏蔽未来帧,但发现其在实时应用中计算开销过大。

实验结果

研究问题

  • RQ1带有因果均值聚合的流式ResLSTM模型是否能在设备导向语音检测中实现优于基于注意力模型的早期预测性能?
  • RQ2因果均值聚合是否在话语结束时保持与注意力机制相当的性能,同时实现更早的决策?
  • RQ3在设备导向语音检测任务中,ResLSTM结构相较于其他架构(如ResNet、CLDNN、LSTM)在EER方面表现如何?
  • RQ4在在线流式设置中,基于注意力的聚合与因果均值聚合的计算成本有何差异?
  • RQ5卷积层缓存是否能有效减少流式推理中的冗余计算,同时不损害模型准确性?

主要发现

  • 所提出的带有因果均值聚合的ResLSTM模型在设备导向与非设备导向语音检测任务中,相比之前最佳模型,等错误率(EER)降低了41%。
  • 因果均值聚合在话语结束时的性能与基于注意力的聚合相当,相比基线模型相对EER改善0.6%。
  • 在早期时间点(如话语开始后1–2秒),因果均值聚合相比注意力机制将EER降低了24.7%,展现出更优的早期决策能力。
  • 在话语中点($0.5L$)评估时,因果均值聚合在$h_t$上的EER相比注意力机制降低16.0%,凸显其对话语结束时间可变性的鲁棒性。
  • 基于RNN的聚合方法(ReLU激活)相比基线模型使EER增加了2.4%,可能由于梯度消失;而tanh变体仅带来0.6%的改进。
  • 因果均值聚合在计算效率上显著优于基于注意力的方法,尤其在必须在每帧重新计算的流式环境中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。