[论文解读] A Monaural Speech Enhancement Method for Robust Small-Footprint Keyword Spotting
本文提出一种联合优化、小尺寸的单通道语音增强方法,用于在资源受限设备上实现鲁棒关键词检测(KWS),采用新型卷积循环网络(CRN)与端到端训练。通过将语音增强前端与基于CNN的KWS模型结合,并利用反向传播联合训练两者,该系统在噪声环境下的鲁棒性显著提升——尤其在使用梅尔倒谱图输入时——同时相比BiLSTM方法,模型参数量和计算量均更少。
Robustness against noise is critical for keyword spotting (KWS) in real-world environments. To improve the robustness, a speech enhancement front-end is involved. Instead of treating the speech enhancement as a separated preprocessing before the KWS system, in this study, a pre-trained speech enhancement front-end and a convolutional neural networks (CNNs) based KWS system are concatenated, where a feature transformation block is used to transform the output from the enhancement front-end into the KWS system's input. The whole model is trained jointly, thus the linguistic and other useful information from the KWS system can be back-propagated to the enhancement front-end to improve its performance. To fit the small-footprint device, a novel convolution recurrent network is proposed, which needs fewer parameters and computation and does not degrade performance. Furthermore, by changing the input features from the power spectrogram to Mel-spectrogram, less computation and better performance are obtained. our experimental results demonstrate that the proposed method significantly improves the KWS system with respect to noise robustness.
研究动机与目标
- 解决在资源受限设备上,真实世界噪声环境中关键词检测(KWS)的鲁棒性挑战。
- 克服多条件训练的局限性,后者需要大型模型,不适用于小尺寸部署。
- 开发一种轻量级语音增强前端,减少参数量与计算量,同时不牺牲性能。
- 通过联合训练增强与KWS模型,提升KWS鲁棒性,使语言信息能够引导增强过程。
- 研究特征域(功率谱图 vs. 梅尔倒谱图)对KWS任务中模型效率与性能的影响。
提出的方法
- 提出一种新型卷积循环网络(CRN)作为轻量级语音增强前端,替代计算量大的BiLSTM模型。
- 通过特征转换模块将增强后的谱图转换为MFCC,实现增强模型与基于CNN的KWS系统的集成。
- 采用端到端联合优化方式训练整个系统,使KWS系统的梯度能够反向更新增强前端。
- 使用理想比值掩蔽(IRM)作为语音增强目标,最小化预测掩蔽与理想掩蔽之间的均方误差(MSE)。
- 通过将含噪谱图与预测掩蔽进行逐元素相乘,生成增强后的谱图。
- 评估时使用梅尔倒谱图为KWS系统的输入,结果表明其在效率与鲁棒性方面优于功率谱图。
实验结果
研究问题
- RQ1轻量级、小尺寸的语音增强模型是否能在不增加计算成本的前提下,提升噪声环境中关键词检测的鲁棒性?
- RQ2联合训练增强与KWS模型是否优于单独训练或多条件训练?
- RQ3梅尔倒谱图是否比功率谱图更适合用作具有语音增强前端的KWS系统的输入表示?
- RQ4增强模型对关键词中音素符号数量的敏感性如何?特征域的选择是否影响这种敏感性?
- RQ5所提模型在训练数据中未见的噪声条件下的泛化能力如何?
主要发现
- 联合训练策略显著优于多条件训练与单独训练,在匹配噪声条件下测试集准确率达到93.17%。
- MelCRN32模型在所有模型中实现了最低的误拒绝率(FRR)1.19%与误报率(FAR)6.20%,优于BiLSTM与PowCRN变体。
- 基于梅尔倒谱图的模型通过减少频带数量,降低了计算量,同时保持或提升了性能,优于基于功率谱图的模型。
- 联合训练的MelCRN32模型在不匹配噪声条件(100种未见噪声)下达到78.12%的准确率,优于BiLSTM与其他CRN变体。
- 基于梅尔倒谱图的模型对关键词中音素符号数量的敏感性更低,AUC下降幅度小于基于功率谱图的模型。
- 窄模型(MelCRN16与PowCRN16)在参数量与计算量显著减少的情况下,性能与全尺寸模型相当,适用于小尺寸设备。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。