Skip to main content
QUICK REVIEW

[论文解读] A Monaural Speech Enhancement Method for Robust Small-Footprint Keyword Spotting

Yue Gu, Zhihao Du|arXiv (Cornell University)|Jun 20, 2019
Speech Recognition and Synthesis参考文献 18被引用 4
一句话总结

本文提出一种联合优化、小尺寸的单通道语音增强方法,用于在资源受限设备上实现鲁棒关键词检测(KWS),采用新型卷积循环网络(CRN)与端到端训练。通过将语音增强前端与基于CNN的KWS模型结合,并利用反向传播联合训练两者,该系统在噪声环境下的鲁棒性显著提升——尤其在使用梅尔倒谱图输入时——同时相比BiLSTM方法,模型参数量和计算量均更少。

ABSTRACT

Robustness against noise is critical for keyword spotting (KWS) in real-world environments. To improve the robustness, a speech enhancement front-end is involved. Instead of treating the speech enhancement as a separated preprocessing before the KWS system, in this study, a pre-trained speech enhancement front-end and a convolutional neural networks (CNNs) based KWS system are concatenated, where a feature transformation block is used to transform the output from the enhancement front-end into the KWS system's input. The whole model is trained jointly, thus the linguistic and other useful information from the KWS system can be back-propagated to the enhancement front-end to improve its performance. To fit the small-footprint device, a novel convolution recurrent network is proposed, which needs fewer parameters and computation and does not degrade performance. Furthermore, by changing the input features from the power spectrogram to Mel-spectrogram, less computation and better performance are obtained. our experimental results demonstrate that the proposed method significantly improves the KWS system with respect to noise robustness.

研究动机与目标

  • 解决在资源受限设备上,真实世界噪声环境中关键词检测(KWS)的鲁棒性挑战。
  • 克服多条件训练的局限性,后者需要大型模型,不适用于小尺寸部署。
  • 开发一种轻量级语音增强前端,减少参数量与计算量,同时不牺牲性能。
  • 通过联合训练增强与KWS模型,提升KWS鲁棒性,使语言信息能够引导增强过程。
  • 研究特征域(功率谱图 vs. 梅尔倒谱图)对KWS任务中模型效率与性能的影响。

提出的方法

  • 提出一种新型卷积循环网络(CRN)作为轻量级语音增强前端,替代计算量大的BiLSTM模型。
  • 通过特征转换模块将增强后的谱图转换为MFCC,实现增强模型与基于CNN的KWS系统的集成。
  • 采用端到端联合优化方式训练整个系统,使KWS系统的梯度能够反向更新增强前端。
  • 使用理想比值掩蔽(IRM)作为语音增强目标,最小化预测掩蔽与理想掩蔽之间的均方误差(MSE)。
  • 通过将含噪谱图与预测掩蔽进行逐元素相乘,生成增强后的谱图。
  • 评估时使用梅尔倒谱图为KWS系统的输入,结果表明其在效率与鲁棒性方面优于功率谱图。

实验结果

研究问题

  • RQ1轻量级、小尺寸的语音增强模型是否能在不增加计算成本的前提下,提升噪声环境中关键词检测的鲁棒性?
  • RQ2联合训练增强与KWS模型是否优于单独训练或多条件训练?
  • RQ3梅尔倒谱图是否比功率谱图更适合用作具有语音增强前端的KWS系统的输入表示?
  • RQ4增强模型对关键词中音素符号数量的敏感性如何?特征域的选择是否影响这种敏感性?
  • RQ5所提模型在训练数据中未见的噪声条件下的泛化能力如何?

主要发现

  • 联合训练策略显著优于多条件训练与单独训练,在匹配噪声条件下测试集准确率达到93.17%。
  • MelCRN32模型在所有模型中实现了最低的误拒绝率(FRR)1.19%与误报率(FAR)6.20%,优于BiLSTM与PowCRN变体。
  • 基于梅尔倒谱图的模型通过减少频带数量,降低了计算量,同时保持或提升了性能,优于基于功率谱图的模型。
  • 联合训练的MelCRN32模型在不匹配噪声条件(100种未见噪声)下达到78.12%的准确率,优于BiLSTM与其他CRN变体。
  • 基于梅尔倒谱图的模型对关键词中音素符号数量的敏感性更低,AUC下降幅度小于基于功率谱图的模型。
  • 窄模型(MelCRN16与PowCRN16)在参数量与计算量显著减少的情况下,性能与全尺寸模型相当,适用于小尺寸设备。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。