[论文解读] Wake Word Detection with Alignment-Free Lattice-Free MMI
本文提出了一种用于混合DNN/HMM唤醒词检测的无对齐 lattice-free 最大互信息(LF-MMI)训练方法,消除了训练过程中对帧级对齐的需求,并引入了专用的静音模型以提升准确性。该系统在三个真实世界数据集上,于指定误报率下将误拒绝率降低了50%–90%,性能优于先前方法,且模型尺寸极小、训练过程简化。
Always-on spoken language interfaces, e.g. personal digital assistants, rely on a wake word to start processing spoken input. We present novel methods to train a hybrid DNN/HMM wake word detection system from partially labeled training data, and to use it in on-line applications: (i) we remove the prerequisite of frame-level alignments in the LF-MMI training algorithm, permitting the use of un-transcribed training examples that are annotated only for the presence/absence of the wake word; (ii) we show that the classical keyword/filler model must be supplemented with an explicit non-speech (silence) model for good performance; (iii) we present an FST-based decoder to perform online detection. We evaluate our methods on two real data sets, showing 50%--90% reduction in false rejection rates at pre-specified false alarm rates over the best previously published figures, and re-validate them on a third (large) data set.
研究动机与目标
- 消除唤醒词检测中LF-MMI训练对帧级对齐的依赖,从而支持仅标注唤醒词存在/不存在的弱监督数据。
- 通过引入显式的非语音(静音)HMM模型来提升检测性能,该模型对于处理背景静音并减少误报至关重要。
- 设计一种基于FST的高效在线解码器,专为始终在线语音界面中的实时唤醒词检测而优化。
- 在真实世界数据集上实现最先进性能,且架构复杂度极低,无需发音词典或转录文本。
提出的方法
- 采用单个具有固定状态数的HMM来建模整个唤醒词,替代基于音素的HMM,从而降低模型复杂度。
- 在话语的起始和结尾引入专用的静音(SIL)HMM作为可选状态,用于建模非语音声音,提升鲁棒性。
- 通过直接从假设构建分子图,实现无对齐的LF-MMI训练,无需依赖先前模型的强制对齐。
- 使用快速的基于FST的解码器,实时高效计算唤醒词与填充词得分的比值,以支持在线推理。
- 通过LF-MMI进行序列级判别性训练,优化模型的序列级检测性能,而非帧级准确率。
- 通过第二阶段的常规LF-MMI训练对系统进行精炼,利用无对齐模型生成的对齐结果,实现通过迭代优化提升性能。
实验结果
研究问题
- RQ1能否在保持或提升性能的前提下,使唤醒词检测的LF-MMI训练实现无对齐?
- RQ2引入专用静音模型是否能显著提升检测准确性,尤其是在减少因音调变化或非语音声音引起的误报方面?
- RQ3仅使用固定状态数的单一HMM能否有效建模整个唤醒词,而无需音素状态分解?
- RQ4与基于帧级对齐或端到端方法相比,所提出的无对齐LF-MMI方法在误拒绝率和误报警率方面表现如何?
- RQ5该系统能否在无需转录文本、发音词典或强制对齐的情况下,实现在真实世界数据集上的卓越性能?
主要发现
- 无对齐的LF-MMI方法在SNIPS数据集上将误拒绝率(FRR)降低至0%(在误报警率(FAH)为0.5时),优于先前最佳结果(0.12% FRR)。
- 在Mobvoi数据集上,系统在FAH为1.5时,FRR相对降低了90%(0.4% vs. 约3.6%),优于最先进基于注意力的方法。
- 在Mobvoi(SLR87)数据集上,系统在FAH=0.5时,对两个唤醒词的FRR分别降低了50%–70%(分别为0.4%和0.5%),优于基线方法。
- 引入专用静音模型显著提升了性能,尤其在减少由音调变化或非语音声音引起的误报方面效果明显。
- 通过使用来自无对齐模型的对齐结果进行第二阶段常规LF-MMI训练,SNIPS数据集上的FRR从0.2%降至0.1%,Mobvoi数据集上从0.4%降至0.3%,表明性能可实现渐进提升。
- 系统仅使用150k参数即实现优异性能,表明在序列级判别性准则下训练时,紧凑模型可超越更大更复杂的架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。