Skip to main content
QUICK REVIEW

[论文解读] Efficient Convolutional Neural Network For Audio Event Detection

Matthias Meyer, Lukas Cavigelli|arXiv (Cornell University)|Sep 28, 2017
Music and Audio Processing参考文献 13被引用 11
一句话总结

本文提出了一种高度高效的卷积神经网络(CNN)用于音频事件检测,与最先进模型相比,内存使用量减少了515倍,计算操作减少了2.1倍,同时准确率提高了9.2%。该方法采用结构化、深度可分离的CNN架构,不包含全连接层,可在低功耗嵌入式系统(如ARM Cortex-M7设备)上实现实时推理。

ABSTRACT

Wireless distributed systems as used in sensor networks, Internet-of-Things and cyber-physical systems, impose high requirements on resource efficiency. Advanced preprocessing and classification of data at the network edge can help to decrease the communication demand and to reduce the amount of data to be processed centrally. In the area of distributed acoustic sensing, the combination of algorithms with a high classification rate and resource-constraint embedded systems is essential. Unfortunately, algorithms for acoustic event detection have a high memory and computational demand and are not suited for execution at the network edge. This paper addresses these aspects by applying structural optimizations to a convolutional neural network for audio event detection to reduce the memory requirement by a factor of more than 500 and the computational effort by a factor of 2.1 while performing 9.2% better.

研究动机与目标

  • 为解决最先进CNN在音频事件检测中对高内存和计算资源的需求,这些需求阻碍了其在低功耗嵌入式系统中的部署。
  • 开发一种资源高效的CNN架构,在大幅减少参数数量和乘加操作(MAC)的同时保持高分类准确率。
  • 实现在内存和处理能力有限的边缘设备(如传感器节点和微控制器)上直接进行实时音频事件检测。
  • 设计一种与硬件加速器兼容的网络结构,以在边缘计算环境中提升能效。

提出的方法

  • 模型采用基于短时傅里叶变换(STFT)的前端,将原始音频转换为时频表示。
  • 采用深度可分离卷积架构,以减少参数数量和计算复杂度,同时保持特征提取能力。
  • 用全局平均池化替代全连接层,以最小化模型大小和参数数量。
  • 使用ADAM优化器和交叉熵损失函数,在ESC-50数据集的4秒窗口输入上进行训练。
  • 通过确保规则且结构化的计算模式,使网络架构适配硬件加速器的内存访问和计算模式,以实现硬件优化。
  • 主实验中未使用数据增强,以隔离架构设计对性能和效率的影响。

实验结果

研究问题

  • RQ1是否可以显著提升基于CNN的音频事件检测模型在内存和计算方面的效率,而不会牺牲准确率?
  • RQ2通过深度可分离卷积和全局平均池化等架构改进,能在多大程度上减少模型大小和推理成本?
  • RQ3是否可以将高度高效的CNN实现实时部署在内存和处理能力有限的低功耗嵌入式微控制器上?
  • RQ4当不使用复杂数据增强进行训练时,所提出的架构是否能保持或提升与最先进模型相比的分类准确率?

主要发现

  • 所提出的CNN-C和CNN-CNP模型在不使用数据增强的情况下,分别实现了86.0%和85.1%的准确率,优于相同条件下参考模型A和B的77.9%和80.3%的准确率。
  • 内存需求降低了515倍,从参考模型的466 MB降至所提模型的约904 kB。
  • 乘加操作(MAC)数量减少了2.1倍,从模型B的3533 M降至CNN-CNP的1239 M。
  • 当两者均在不使用数据增强的条件下评估时,所提模型相比参考模型A实现了9.2%的准确率提升。
  • 该模型可部署于低功耗设备(如NXP KV5x和ST STM32F7),其闪存内存最高达2 MB,处理能力超过430 M MAC/s,支持实时推理。
  • 结构化、纯卷积的架构非常适合硬件加速器,可进一步提升能效和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。