Skip to main content
QUICK REVIEW

[论文解读] Wake Word Detection with Alignment-Free Lattice-Free MMI

Yiming Wang, Hang Lv|arXiv (Cornell University)|May 17, 2020
Speech Recognition and Synthesis参考文献 39被引用 5
一句话总结

本文提出了一种用于混合DNN/HMM唤醒词检测的无对齐 lattice-free 最大互信息(LF-MMI)训练方法,消除了训练过程中对帧级对齐的需求,并引入了专用的静音模型以提升准确性。该系统在三个真实世界数据集上,于指定误报率下将误拒绝率降低了50%–90%,性能优于先前方法,且模型尺寸极小、训练过程简化。

ABSTRACT

Always-on spoken language interfaces, e.g. personal digital assistants, rely on a wake word to start processing spoken input. We present novel methods to train a hybrid DNN/HMM wake word detection system from partially labeled training data, and to use it in on-line applications: (i) we remove the prerequisite of frame-level alignments in the LF-MMI training algorithm, permitting the use of un-transcribed training examples that are annotated only for the presence/absence of the wake word; (ii) we show that the classical keyword/filler model must be supplemented with an explicit non-speech (silence) model for good performance; (iii) we present an FST-based decoder to perform online detection. We evaluate our methods on two real data sets, showing 50%--90% reduction in false rejection rates at pre-specified false alarm rates over the best previously published figures, and re-validate them on a third (large) data set.

研究动机与目标

  • 消除唤醒词检测中LF-MMI训练对帧级对齐的依赖,从而支持仅标注唤醒词存在/不存在的弱监督数据。
  • 通过引入显式的非语音(静音)HMM模型来提升检测性能,该模型对于处理背景静音并减少误报至关重要。
  • 设计一种基于FST的高效在线解码器,专为始终在线语音界面中的实时唤醒词检测而优化。
  • 在真实世界数据集上实现最先进性能,且架构复杂度极低,无需发音词典或转录文本。

提出的方法

  • 采用单个具有固定状态数的HMM来建模整个唤醒词,替代基于音素的HMM,从而降低模型复杂度。
  • 在话语的起始和结尾引入专用的静音(SIL)HMM作为可选状态,用于建模非语音声音,提升鲁棒性。
  • 通过直接从假设构建分子图,实现无对齐的LF-MMI训练,无需依赖先前模型的强制对齐。
  • 使用快速的基于FST的解码器,实时高效计算唤醒词与填充词得分的比值,以支持在线推理。
  • 通过LF-MMI进行序列级判别性训练,优化模型的序列级检测性能,而非帧级准确率。
  • 通过第二阶段的常规LF-MMI训练对系统进行精炼,利用无对齐模型生成的对齐结果,实现通过迭代优化提升性能。

实验结果

研究问题

  • RQ1能否在保持或提升性能的前提下,使唤醒词检测的LF-MMI训练实现无对齐?
  • RQ2引入专用静音模型是否能显著提升检测准确性,尤其是在减少因音调变化或非语音声音引起的误报方面?
  • RQ3仅使用固定状态数的单一HMM能否有效建模整个唤醒词,而无需音素状态分解?
  • RQ4与基于帧级对齐或端到端方法相比,所提出的无对齐LF-MMI方法在误拒绝率和误报警率方面表现如何?
  • RQ5该系统能否在无需转录文本、发音词典或强制对齐的情况下,实现在真实世界数据集上的卓越性能?

主要发现

  • 无对齐的LF-MMI方法在SNIPS数据集上将误拒绝率(FRR)降低至0%(在误报警率(FAH)为0.5时),优于先前最佳结果(0.12% FRR)。
  • 在Mobvoi数据集上,系统在FAH为1.5时,FRR相对降低了90%(0.4% vs. 约3.6%),优于最先进基于注意力的方法。
  • 在Mobvoi(SLR87)数据集上,系统在FAH=0.5时,对两个唤醒词的FRR分别降低了50%–70%(分别为0.4%和0.5%),优于基线方法。
  • 引入专用静音模型显著提升了性能,尤其在减少由音调变化或非语音声音引起的误报方面效果明显。
  • 通过使用来自无对齐模型的对齐结果进行第二阶段常规LF-MMI训练,SNIPS数据集上的FRR从0.2%降至0.1%,Mobvoi数据集上从0.4%降至0.3%,表明性能可实现渐进提升。
  • 系统仅使用150k参数即实现优异性能,表明在序列级判别性准则下训练时,紧凑模型可超越更大更复杂的架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。