Skip to main content
QUICK REVIEW

[论文解读] MatchboxNet: 1D Time-Channel Separable Convolutional Neural Network Architecture for Speech Commands Recognition

Somshubra Majumdar, Boris Ginsburg|arXiv (Cornell University)|Apr 18, 2020
Speech Recognition and Synthesis参考文献 33被引用 82
一句话总结

MatchboxNet 是一种紧凑的端到端一维卷积神经网络,用于语音命令识别,通过使用时间-通道可分离卷积,在参数数量显著减少的情况下,实现了在 Google 语音命令数据集上的最先进准确率。该模型在保持高效率和可扩展性的同时,通过使用背景噪声和语音进行密集数据增强,提升了鲁棒性。

ABSTRACT

We present an MatchboxNet - an end-to-end neural network for speech command recognition. MatchboxNet is a deep residual network composed from blocks of 1D time-channel separable convolution, batch-normalization, ReLU and dropout layers. MatchboxNet reaches state-of-the-art accuracy on the Google Speech Commands dataset while having significantly fewer parameters than similar models. The small footprint of MatchboxNet makes it an attractive candidate for devices with limited computational resources. The model is highly scalable, so model accuracy can be improved with modest additional memory and compute. Finally, we show how intensive data augmentation using an auxiliary noise dataset improves robustness in the presence of background noise.

研究动机与目标

  • 开发一种适用于低资源边缘设备的紧凑、高效的关键词检测深度学习模型。
  • 在不牺牲与现有语音命令识别模型相比的准确率的前提下,减少模型参数量。
  • 通过先进的数据增强技术,提升对背景噪声和语音的鲁棒性。
  • 展示该架构在不同模型尺寸和硬件约束下的可扩展性。

提出的方法

  • 该模型使用一维时间-通道可分离卷积,在保持性能的同时减少参数数量。
  • 其结构为深度残差网络,包含多个残差块,每个残差块内含多个子块,包含批量归一化、ReLU 和 Dropout。
  • 架构包含一个前导子块和一个后继子块,用于在主残差块之前和之后进行特征变换。
  • 应用了广泛的增强数据,包括时间偏移、白噪声、SpecAugment、SpecCutout,以及来自 Freesound 数据库的额外背景噪声。
  • 使用 NovoGrad 优化器进行训练,采用预热-保持-衰减学习率调度,并在 V-100 GPU 上使用混合精度训练。
  • 通过在包含真实世界环境噪声和背景语音的增强数据集上重新训练,进一步增强了鲁棒性。

实验结果

研究问题

  • RQ1一维时间-通道可分离卷积架构是否能在参数量少于现有模型的情况下,实现语音命令识别的最先进准确率?
  • RQ2在 MatchboxNet 中,增加深度(B×R)或宽度(C)时,模型可扩展性如何影响性能?
  • RQ3在训练中使用辅助背景噪声在多大程度上提升了对真实世界噪声条件的鲁棒性?
  • RQ4该模型是否能在高度紧凑的同时保持高准确率,适用于边缘设备的部署?
  • RQ5在不同信噪比(SNR)的噪声环境中,模型表现如何?

主要发现

  • MatchboxNet-3x2x64 在 Google 语音命令数据集 v1 上实现了 97.48% 的准确率,仅使用 93K 个参数,优于 DenseNet-BC-100(800K 参数)和 EdgeSpeechNet-A(107K 参数)等模型。
  • 在 v2 上,MatchboxNet-3x2x64 达到 97.21% 的准确率,仅使用 93K 个参数,接近更大模型 'Embedding + Head'(385K 参数)的性能。
  • 将模型扩展为 MatchboxNet-6x2x64 后,v2 上的准确率提升至 97.55%,表明在参数增长极少的情况下具有极强的可扩展性。
  • 使用额外背景噪声和语音增强训练的模型在干净测试数据上达到 97.05% 的准确率,表明与基础增强相比无性能下降。
  • 在噪声环境中(SNR 从 -10 dB 到 50 dB),MatchboxNet-6x2x64 在 50 dB SNR 下保持 97.33% 的准确率,优于所有 SNR 水平下的较小 3x1x64 变体。
  • 在包含背景语音和噪声类别的数据集上训练的模型,在扩展的 v2 数据集上达到 96.97% 的准确率,证实了在真实世界环境中鲁棒性的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。