Skip to main content
QUICK REVIEW

[论文解读] Sequence-to-sequence Models for Small-Footprint Keyword Spotting

Haitong Zhang, Junbo Zhang|arXiv (Cornell University)|Nov 1, 2018
Topic Modeling参考文献 14被引用 6
一句话总结

本文提出了一种序列到序列(seq2seq)关键词唤醒模型,通过消除对固定滑动窗口的依赖,简化了端到端KWS流程,实现了低延迟、小内存占用的推理。该基于GRU的模型仅需约73K个参数,在真实唤醒数据上实现了每小时0.1次误报率下的3.05%误拒绝率,优于基于注意力机制的基线模型,并通过帧级概率平滑展现出出色的鲁棒性。

ABSTRACT

In this paper, we propose a sequence-to-sequence model for keyword spotting (KWS). Compared with other end-to-end architectures for KWS, our model simplifies the pipelines of production-quality KWS system and satisfies the requirement of high accuracy, low-latency, and small-footprint. We also evaluate the performances of different encoder architectures, which include LSTM and GRU. Experiments on the real-world wake-up data show that our approach outperforms the recently proposed attention-based end-to-end model. Specifically speaking, with 73K parameters, our sequence-to-sequence model achieves $\sim$3.05\% false rejection rate (FRR) at 0.1 false alarm (FA) per hour.

研究动机与目标

  • 解决现有端到端KWS模型依赖于任意滑动窗口或训练/解码策略不匹配的局限性。
  • 开发一种轻量化、低延迟的KWS系统,适用于移动设备,具备高精度和小内存占用。
  • 评估在seq2seq框架中不同RNN编码器(LSTM与GRU)在关键词唤醒任务中的表现。
  • 研究概率平滑对检测鲁棒性和性能稳定性的影响。

提出的方法

  • 该模型采用序列到序列的训练范式,输入为声学特征,输出为表示帧级关键词是否存在的一维热编码标签。
  • 使用TDNN-LSTM模型生成的帧级对齐结果作为训练标签,对模糊帧(如关键词部分)标记为-1,并赋予零损失权重。
  • 注意力机制从编码器隐藏状态中计算上下文向量,通过Softmax层生成最终的关键词概率。
  • 推理过程中,模型逐帧处理并输出每帧的检测概率,随后在n个连续帧上进行平滑处理以提升可靠性。
  • 平滑操作计算n帧内的平均概率:$\hat{y}_t = \frac{1}{n} \sum_{i=t-n+1}^{t} y_i$。
  • 模型使用归一化权重初始化和Adam优化器,通过交叉熵损失进行训练。

实验结果

研究问题

  • RQ1序列到序列模型是否能在保持或提升准确率的同时,消除端到端关键词唤醒中对固定滑动窗口的依赖?
  • RQ2在真实数据上,所提出的seq2seq模型与基于注意力机制的基线模型相比,其误拒绝率(FRR)和误报率(FA率)表现如何?
  • RQ3编码器架构(LSTM与GRU)及宽度(64与128个单元)对模型准确率和参数量的影响是什么?
  • RQ4帧级概率平滑是否能提升检测鲁棒性并降低误拒绝率?

主要发现

  • 采用1层128个单元的GRU模型在每小时0.1次误报率下实现了3.05%的误拒绝率,相比基线GRU模型性能提升约20%。
  • 1-128 GRU模型仅需73.3K个参数即可实现3.05%的FRR,展现出高效率与小内存占用特性。
  • 1-128模型(LSTM与GRU)显著优于更深或更窄的变体,表明在此设置下更宽的网络比更深的网络性能更优。
  • 使用n=12进行概率平滑后,GRU 1-128模型的FRR相比无平滑情况降低了0.06%,证实其在提升鲁棒性方面的有效性。
  • 基线模型中的注意力机制过度聚焦于最后一个字符,而seq2seq模型则学习到更接近人类行为的注意力模式,仅在完整关键词被感知后才激活。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。