[论文解读] Towards Low-Latency Energy-Efficient Deep SNNs via Attention-Guided Compression
本文提出一种基于注意力引导的非迭代压缩框架,用于深度脉冲神经网络(SNNs),通过利用预训练人工神经网络(ANN)的注意力图来指导结构化与非结构化剪枝,实现高达33.4倍的超高压缩率,同时保持极小的精度损失。随后采用基于稀疏学习的SNN训练方法,并结合直接输入编码,显著降低推理延迟并提升能效。在CIFAR-10数据集上,该方法相较未压缩的ANN实现高达98倍的计算能效提升。
Deep spiking neural networks (SNNs) have emerged as a potential alternative to traditional deep learning frameworks, due to their promise to provide increased compute efficiency on event-driven neuromorphic hardware. However, to perform well on complex vision applications, most SNN training frameworks yield large inference latency which translates to increased spike activity and reduced energy efficiency. Hence,minimizing average spike activity while preserving accuracy indeep SNNs remains a significant challenge and opportunity.This paper presents a non-iterative SNN training technique thatachieves ultra-high compression with reduced spiking activitywhile maintaining high inference accuracy. In particular, our framework first uses the attention-maps of an un compressed meta-model to yield compressed ANNs. This step can be tuned to support both irregular and structured channel pruning to leverage computational benefits over a broad range of platforms. The framework then performs sparse-learning-based supervised SNN training using direct inputs. During the training, it jointly optimizes the SNN weight, threshold, and leak parameters to drastically minimize the number of time steps required while retaining compression. To evaluate the merits of our approach, we performed experiments with variants of VGG and ResNet, on both CIFAR-10 and CIFAR-100, and VGG16 on Tiny-ImageNet.The SNN models generated through the proposed technique yield SOTA compression ratios of up to 33.4x with no significant drops in accuracy compared to baseline unpruned counterparts. Compared to existing SNN pruning methods, we achieve up to 8.3x higher compression with improved accuracy.
研究动机与目标
- 为解决深度SNN推理延迟高与能耗大的问题,以推动其在资源受限边缘设备中的部署。
- 在无批归一化层的情况下,实现无需迭代或复杂优化的高精度压缩SNN,提升能效。
- 开发一种非迭代、端到端的训练框架,支持非结构化与结构化剪枝,以实现广泛的硬件兼容性。
- 通过直接输入编码与SNN参数的联合优化,最小化脉冲活动与时间步数,从而提升SNN推理效率。
提出的方法
- 利用未剪枝、预训练的元ANN(meta-ANN)生成的注意力图,指导ANN进行结构化或非结构化通道剪枝,构建稀疏、低密度结构。
- 通过依次固定各层阈值(基于ANN激活统计特性),将压缩后的ANN转换为SNN。
- 采用基于稀疏学习的监督训练方法,在SNN上使用直接输入编码,联合优化SNN权重、阈值与漏电流参数,以最小化时间步数。
- 利用稀疏学习的非迭代特性,避免在无批归一化网络中常见的逐层密度调优与梯度爆炸问题。
- 同时支持非结构化与结构化剪枝,实现跨平台硬件透明部署,适用于具备或不具备专用稀疏加速器的设备。
- 采用直接输入编码以减少脉冲活动与FLOPs,尤其在浅层中显著提升延迟与能效表现。
实验结果
研究问题
- RQ1注意力引导的压缩是否可在无需迭代或复杂优化的情况下实现高精度SNN压缩?
- RQ2与速率编码输入相比,直接输入编码在压缩SNN中对脉冲活动与推理延迟有何影响?
- RQ3结构化与非结构化剪枝结合稀疏学习训练,在保持精度的同时,能在多大程度上降低能耗?
- RQ4与现有SNN剪枝技术相比,该方法是否能在深层网络(如VGG与ResNet)上实现更高的压缩率与能效?
主要发现
- 在CIFAR-10数据集上,该方法实现最高达33.4倍的压缩率,且精度损失极小,相比未剪枝SNN保持了良好性能。
- 采用直接输入编码训练的压缩SNN相较未压缩ANN实现高达98倍的计算能效提升,且在VGG16上相较同参数量ANN提升47倍能效。
- 由于直接输入编码与优化的阈值设定,相比基线SNN,平均脉冲活动降低高达约98%,尤其在浅层中效果显著。
- 与现有SNN剪枝方法相比,该方法在CIFAR-10与CIFAR-100上实现最高达8.3倍的压缩率提升,同时精度更高。
- 与速率编码变体相比,直接输入SNN的FLOPs效率最高提升4.5倍,且推理延迟更低。
- 即使在极端压缩水平下,该方法仍保持高精度,通道剪枝模型在浅层的脉冲活动可降低至基线的约1.36倍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。