[论文解读] Multi-Level Firing with Spiking DS-ResNet: Enabling Better and Deeper Directly-Trained Spiking Neural Networks
本文提出多级放电(MLF)和脉冲DS-ResNet,以解决直接训练脉冲神经网络(SNN)中的梯度消失和网络退化问题。MLF通过多阈值脉冲生成扩展了近似导数的非零区域,增强了神经元的表达能力;而脉冲DS-ResNet则实现了离散脉冲的高效恒等映射。该方法在CIFAR10、DVS-Gesture和CIFAR10-DVS数据集上实现了最先进性能,参数量显著减少,并实现了68层SNN的无退化训练。
Spiking neural networks (SNNs) are bio-inspired neural networks with asynchronous discrete and sparse characteristics, which have increasingly manifested their superiority in low energy consumption. Recent research is devoted to utilizing spatio-temporal information to directly train SNNs by backpropagation. However, the binary and non-differentiable properties of spike activities force directly trained SNNs to suffer from serious gradient vanishing and network degradation, which greatly limits the performance of directly trained SNNs and prevents them from going deeper. In this paper, we propose a multi-level firing (MLF) method based on the existing spatio-temporal back propagation (STBP) method, and spiking dormant-suppressed residual network (spiking DS-ResNet). MLF enables more efficient gradient propagation and the incremental expression ability of the neurons. Spiking DS-ResNet can efficiently perform identity mapping of discrete spikes, as well as provide a more suitable connection for gradient propagation in deep SNNs. With the proposed method, our model achieves superior performances on a non-neuromorphic dataset and two neuromorphic datasets with much fewer trainable parameters and demonstrates the great ability to combat the gradient vanishing and degradation problem in deep SNNs.
研究动机与目标
- 解决由于脉冲活动的不可微分性和二值性导致的直接训练SNN中的梯度消失与网络退化问题。
- 通过扩展反向传播中使用的近似导数的非零区域,改善深层SNN中的梯度流动。
- 通过多阈值脉冲生成增强脉冲神经元的表达能力。
- 通过新型残差结构实现在深层SNN中对离散脉冲的有效恒等映射。
- 在参数量更少的前提下,实现在神经形态与非神经形态数据集上的最先进性能。
提出的方法
- 提出多级放电(MLF),将近似导数的覆盖范围分配到多个层级,以扩展导数函数的非零区域。
- 在MLF单元中引入多阈值激活机制,使神经元能根据输入强度在不同阈值下产生脉冲,提升特征表示能力。
- 设计脉冲DS-ResNet,一种残差结构,实现在深层SNN中对离散脉冲信号的高效恒等映射。
- 采用脉冲DS-ResNet降低休眠单元生成的概率,从而改善深层网络中的梯度传播。
- 将MLF与脉冲DS-ResNet结合,提升直接训练SNN中的梯度流动与网络深度能力。
- 使用时空反向传播(STBP)作为训练框架,MLF提升了梯度计算的稳定性和效率。
实验结果
研究问题
- RQ1多级放电能否降低休眠单元比例并缓解深层SNN中的梯度消失?
- RQ2脉冲DS-ResNet能否有效实现对离散脉冲的恒等映射,并减少深层SNN中的网络退化?
- RQ3MLF与脉冲DS-ResNet的结合能否实现无性能退化的极深SNN训练?
- RQ4所提方法能否在参数量更少的前提下,实现在神经形态与非神经形态数据集上的最先进性能?
- RQ5MLF层级数如何影响网络对尖锐特征的表示能力与整体准确率?
主要发现
- MLF显著降低了休眠单元比例,其比例从单层级SNN中的40%以上降至多层级配置下的15%以下。
- 采用MLF的SNN在训练与测试准确率上随层级数增加而逐步提升,其中从K=1到K=2的增益最大。
- 结合MLF的脉冲DS-ResNet使CIFAR10上68层SNN的训练无退化,测试准确率达到93.48%。
- 在CIFAR10上,模型在68层时达到93.48%的准确率,证明该方法能有效抑制极深SNN中的网络退化。
- 该模型在CIFAR10、DVS-Gesture和CIFAR10-DVS上均实现了最先进性能,且可训练参数量显著少于现有方法。
- 消融实验表明,MLF增强了梯度流动与收敛速度,而脉冲DS-ResNet则稳定了深层架构的训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。