Skip to main content
QUICK REVIEW

[论文解读] AutoKWS: Keyword Spotting with Differentiable Architecture Search

Bo Zhang, Wenfeng Li|arXiv (Cornell University)|Sep 8, 2020
Speech and Audio Processing参考文献 29被引用 6
一句话总结

该论文提出 AutoKWS,一种可微分神经架构搜索框架,用于为资源受限设备发现高效且高精度的关键词识别模型。通过在自定义的 TC-ResNet 基搜索空间中应用 NoisyDARTS,该方法在 Google Speech Commands V1 数据集上实现了 97.2% 的 top-1 准确率,参数量仅约 100K,优于先前方法在准确率和模型效率方面的表现。

ABSTRACT

Smart audio devices are gated by an always-on lightweight keyword spotting program to reduce power consumption. It is however challenging to design models that have both high accuracy and low latency for accurate and fast responsiveness. Many efforts have been made to develop end-to-end neural networks, in which depthwise separable convolutions, temporal convolutions, and LSTMs are adopted as building units. Nonetheless, these networks designed with human expertise may not achieve an optimal trade-off in an expansive search space. In this paper, we propose to leverage recent advances in differentiable neural architecture search to discover more efficient networks. Our searched model attains 97.2% top-1 accuracy on Google Speech Command Dataset v1 with only nearly 100K parameters.

研究动机与目标

  • 为具有严格延迟和参数限制的智能音频设备设计轻量化、高精度的关键词识别模型。
  • 克服手动设计神经架构在准确率、模型大小和计算成本之间难以平衡的局限性。
  • 将可微分神经架构搜索(DARTS 及其变体)应用于关键词识别任务,实现高效且适合在物联网设备上部署的搜索方法。
  • 评估经过改进的 DARTS 变体(如 NoisyDARTS)是否能在 KWS 领域中生成性能更优、更稳定的架构,优于标准 DARTS。

提出的方法

  • 基于 TC-ResNet-SE 模块设计搜索空间,其中每一层包含多个候选操作(如不同卷积核大小、深度可分离卷积)和跳跃连接,每个操作由可学习的架构参数 α 加权。
  • 采用可微分架构搜索与基于梯度的优化方法,联合训练网络权重和架构系数,实现在单个训练循环中的端到端搜索。
  • 应用两种改进的 DARTS 变体——FairDARTS 和 NoisyDARTS——以缓解已知的不稳定性问题,如跳跃连接的过度使用和梯度竞争不公。
  • 在 NoisyDARTS 中向跳跃连接的特征图注入噪声,以降低其梯度主导性,提升搜索稳定性。
  • 在 Google Speech Commands 数据集 V1 和 V2 上训练并评估所搜索到的模型,比较其在准确率、参数量和乘加操作数方面的性能。
  • 采用一次性权重共享机制,大幅降低搜索成本,实现对大规模架构空间的高效探索。

实验结果

研究问题

  • RQ1可微分神经架构搜索能否有效发现适用于边缘设备的轻量化、高精度关键词识别模型?
  • RQ2与标准 DARTS 相比,FairDARTS 和 NoisyDARTS 等改进的 DARTS 变体在 KWS 任务中如何提升搜索稳定性和性能?
  • RQ3所提出的基于 TC-ResNet-SE 模块的搜索空间设计,是否能发现准确率和效率均优于人工设计基线的架构?
  • RQ4在跳跃连接中引入噪声(NoisyDARTS)在多大程度上减少了对残差连接的偏好,并提升了所搜索架构的质量?
  • RQ5所搜索的模型能否在不同版本的 Speech Commands 数据集上良好泛化,特别是在 V2 版本数据量增加的情况下?

主要发现

  • NoisyDARTS-TC14 模型在 Google Speech Commands V2 数据集上实现了 97.18% 的平均准确率和 97.44% 的最佳准确率,优于先前方法在准确率和效率方面的表现。
  • NoisyDARTS-TC14 模型在 V1 数据集上实现了 97.2% 的 top-1 准确率,参数量仅为 109K,远低于同期方法 NAS2 的 886K 参数量。
  • 与 NAS2 相比,NoisyDARTS 变体将平均参数量减少了近 8 倍,证明了其在架构搜索效率方面的卓越表现。
  • ROC 曲线分析表明,NoisyDARTS-TC14 模型在假阴性与假阳性权衡方面优于 MHAtt-RNN 和一个增强版 TC-ResNet-365K 模型。
  • FairDARTS 和 NoisyDARTS 均缓解了标准 DARTS 中跳跃连接过度使用的问题,生成了更具多样性且性能更高的架构。
  • 搜索过程稳定且可复现,NoisyDARTS 在多次运行中始终找到优于随机搜索和标准 DARTS 的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。