Skip to main content
QUICK REVIEW

[论文解读] Small-Footprint Open-Vocabulary Keyword Spotting with Quantized LSTM Networks

Théodore Bluche, Maël Primet|arXiv (Cornell University)|Feb 25, 2020
Speech Recognition and Synthesis被引用 11
一句话总结

该论文提出了一种小尺寸、开放词汇的关键词检测系统,采用量化LSTM网络并使用连接时序分类(CTC)进行训练,可在模型大小低于500KB的情况下实现在微控制器上的实时关键词检测。通过利用CTC输出特性进行置信度校准和高效解码,该方法在无需关键词特定训练数据的情况下,于开放词汇任务中实现了较高的F1分数,优于标准的填充词模型基线。

ABSTRACT

We explore a keyword-based spoken language understanding system, in which the intent of the user can directly be derived from the detection of a sequence of keywords in the query. In this paper, we focus on an open-vocabulary keyword spotting method, allowing the user to define their own keywords without having to retrain the whole model. We describe the different design choices leading to a fast and small-footprint system, able to run on tiny devices, for any arbitrary set of user-defined keywords, without training data specific to those keywords. The model, based on a quantized long short-term memory (LSTM) neural network, trained with connectionist temporal classification (CTC), weighs less than 500KB. Our approach takes advantage of some properties of the predictions of CTC-trained networks to calibrate the confidence scores and implement a fast detection algorithm. The proposed system outperforms a standard keyword-filler model approach.

研究动机与目标

  • 在无需微调或关键词特定数据的情况下,实现在设备端对任意用户自定义关键词的实时关键词检测。
  • 设计一种适用于物联网和边缘设备中微控制器的紧凑型、量化神经网络(模型大小低于500KB)。
  • 利用CTC训练网络的结构特性,实现在自然语言查询中对多个关键词的高效、准确检测。
  • 在开放词汇设置下,以极低计算开销超越现有基线方法(如LVCSR和关键词填充模型)

提出的方法

  • 在通用自动语音识别(ASR)数据上使用连接时序分类(CTC)训练量化长短期记忆(LSTM)网络,实现端到端学习,无需关键词级别的标注。
  • 系统采用置信度分数归一化技术,将CTC分数除以空白帧数量的估计值,提升检测准确率。
  • 检测算法在解码过程中跳过空白帧,使计算量减少两倍,同时保持性能不变。
  • 通过贪婪或序列后处理步骤,从CTC输出的格网中识别关键词序列,使用最小编辑距离或类似标准。
  • 通过权重量化和网络结构剪枝对模型进行推理速度与内存占用优化,实现小于500KB的模型大小。
  • 通过直接利用CTC网络预测音素后验概率和处理可变长度序列的能力,避免了对独立填充词模型的需求。

实验结果

研究问题

  • RQ1一个经过CTC训练的量化LSTM模型是否能在无需关键词特定微调的情况下,检测自然语言查询中的任意用户自定义关键词?
  • RQ2基于空白帧估计的置信度分数归一化方法在开放词汇关键词检测中的准确率影响如何?
  • RQ3在解码过程中跳过空白帧在速度和准确率方面的性能提升如何?
  • RQ4所提方法与标准基线(如使用维特比解码的LVCSR和关键词填充模型)在开放词汇设置下的表现相比如何?
  • RQ5一个小型量化模型(<500KB)是否能在真实世界的小型SLU任务中实现具有竞争力的性能,且延迟极低?

主要发现

  • 采用量化5x96 LSTM架构的所提方法在噪声环境下于'smart light'数据集上达到0.808的F1分数,在'washing machine'数据集上达到0.725,优于填充词模型基线。
  • 使用基于空白帧估计的置信度分数归一化(C_nb)在所有数据集上均取得最佳检测性能,相比原始置信度分数,F1分数最高提升达10%。
  • 通过在解码过程中跳过空白帧,检测算法实现了两倍的速度提升,且未牺牲准确率。
  • 序列后处理方法优于贪婪方法,在'washing machine'数据集上即使使用更大的TDNN-LSTM网络,其F1分数也高于填充词模型。
  • 系统模型大小小于500KB,可在微控制器上实现实时推理,同时在噪声环境中保持鲁棒性。
  • 该方法优于LVCSR的'转录'基线和基于格网的方法,证明了基于CTC的开放词汇关键词检测相比标准ASR流水线具有优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。