Skip to main content
QUICK REVIEW

[论文解读] Streaming Small-Footprint Keyword Spotting using Sequence-to-Sequence Models

Yanzhang He, Rohit Prabhavalkar|arXiv (Cornell University)|Oct 26, 2017
Speech Recognition and Synthesis参考文献 35被引用 4
一句话总结

本文提出了一种流式、小模型尺寸的关键词检测系统,采用循环神经网络转换器(RNN-T)并引入一种新颖的基于注意力的关键词偏置技术,以提升任意关键词的检测效果。RNN-T模型联合学习声学与语言建模,结合音素目标和词结束标记(<eow>),在每小时0.05次误报率下,相较于强基线的CTC模型,误检率降低了39%(8.9% vs. 14.5%)。

ABSTRACT

We develop streaming keyword spotting systems using a recurrent neural network transducer (RNN-T) model: an all-neural, end-to-end trained, sequence-to-sequence model which jointly learns acoustic and language model components. Our models are trained to predict either phonemes or graphemes as subword units, thus allowing us to detect arbitrary keyword phrases, without any out-of-vocabulary words. In order to adapt the models to the requirements of keyword spotting, we propose a novel technique which biases the RNN-T system towards a specific keyword of interest. Our systems are compared against a strong sequence-trained, connectionist temporal classification (CTC) based "keyword-filler" baseline, which is augmented with a separate phoneme language model. Overall, our RNN-T system with the proposed biasing technique significantly improves performance over the baseline system.

研究动机与目标

  • 开发一种适用于移动设备部署的流式、低资源关键词检测系统。
  • 通过使用音素或字素等子词单元,实现对任意关键词的检测,避免未登录词(OOV)问题。
  • 在RNN-T框架中引入一种新颖的基于注意力的偏置机制,提升特定关键词的检测准确率。
  • 评估在流式KWS设置下,基于音素与字素目标训练的RNN-T模型的性能表现。
  • 将所提出的RNN-T系统与具备外部语言模型的强基线CTC模型进行对比。

提出的方法

  • 系统采用循环神经网络转换器(RNN-T)实现端到端的序列到序列学习,联合建模声学与语言成分。
  • 模型被训练为预测音素或字素作为子词单元,从而实现对任意关键词的检测,避免OOV问题。
  • 提出了一种新颖的关键词偏置技术,利用注意力机制在推理过程中引导模型关注特定关键词。
  • 该偏置机制引入一个可学习的<eokw>标记,并在解码过程中将注意力权重聚焦于关键词的音素序列。
  • 使用词结束标记(<eow>)表示关键词预测的结束,相比无此标记的模型,性能得到提升。
  • 系统采用标准KWS测试集进行评估,评估指标包括每小时误检率(FR)和误报率(FA)

实验结果

研究问题

  • RQ1基于RNN-T的序列到序列模型是否能在流式、小模型尺寸的设置下实现具有竞争力的关键词检测性能?
  • RQ2在RNN-T模型中,基于音素与字素目标的训练对关键词检测准确率有何影响?
  • RQ3与强基线的CTC模型相比,所提出的基于注意力的关键词偏置机制是否能显著降低误检率?
  • RQ4<eow>标记对RNN-T在关键词检测中的性能有何影响?
  • RQ5模型在正样本与负样本关键词语音中的注意力行为有何差异?

主要发现

  • 在每小时0.05次误报率下,基于音素目标并使用<eow>标记的RNN-T模型误检率为11.1%,优于CTC基线模型。
  • 所提出的关键词偏置技术将误检率降低至每小时0.05次误报率下为8.9%,相比基线实现了39%的相对改进。
  • 基于字素目标的RNN-T模型性能劣于基于音素的模型,误检率在正则化前为15.5%,正则化后为14.0%。
  • 在偏置RNN-T系统中,注意力机制在正样本语音中明显聚焦于关键词的音素,注意力权重呈现明显的对角线模式。
  • 在负样本语音中,注意力分散在关键词的初始音素和<n/a>标记上,表明模型未能成功锁定关键词。
  • 各关键词误检率的直方图显示,大多数低于15%,仅有少数异常值,表明系统在多样化关键词上具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。