Skip to main content
QUICK REVIEW

[论文解读] The fine line between dead neurons and sparsity in binarized spiking neural networks

Jason K. Eshraghian, Wei Lü|arXiv (Cornell University)|Jan 28, 2022
Advanced Memory and Neural Computing被引用 18
一句话总结

本文提出阈值退火——一种暖启动策略,通过在二值化脉冲神经网络(BSNNs)中逐步提高放电阈值,以平衡脉冲活动与动态范围。通过实现早期网络活动和后期高精度状态累积,该方法将死神经元数量减少71%,并在仅使用二值化权重的情况下,在四个数据集上实现了最先进(SOTA)的准确率。

ABSTRACT

Spiking neural networks can compensate for quantization error by encoding information either in the temporal domain, or by processing discretized quantities in hidden states of higher precision. In theory, a wide dynamic range state-space enables multiple binarized inputs to be accumulated together, thus improving the representational capacity of individual neurons. This may be achieved by increasing the firing threshold, but make it too high and sparse spike activity turns into no spike emission. In this paper, we propose the use of `threshold annealing' as a warm-up method for firing thresholds. We show it enables the propagation of spikes across multiple layers where neurons would otherwise cease to fire, and in doing so, achieve highly competitive results on four diverse datasets, despite using binarized weights. Source code is available at https://github.com/jeshraghian/snn-tha/

研究动机与目标

  • 为解决二值化脉冲神经网络(BSNNs)中脉冲活动与动态范围之间的权衡问题,其中高阈值会抑制放电,而低阈值会限制表征能力。
  • 减少训练过程中完全停止放电的死神经元数量,以避免梯度流动受阻并加快收敛速度。
  • 在不增加权重精度的前提下,通过在训练过程中动态调整放电阈值,提升BSNN的学习效率与准确率。
  • 通过在早期保持足够的深层活动,同时在后期阶段仍能利用高精度状态累积,实现对稀疏活跃网络的有效反向传播。

提出的方法

  • 提出阈值退火:一种暖启动技术,使放电阈值 θ 随训练迭代次数逐渐增加,起始值较低,最终趋于一个较高的稳定值。
  • 在推理阶段使用固定阈值,该阈值源自训练结束时达到的最终阈值,确保极低的内存开销(每层仅需一个全精度值)。
  • 在标准反向传播框架内应用该方法,阈值更新发生在训练循环外部,以避免对梯度产生干扰。
  • 采用动态范围(DR)演化策略,模拟状态空间精度的自然演进过程,平衡早期活动与后期累积。
  • 利用具有漏电积分-放电特性的脉冲神经元模型,其中当膜电位 u^j_t 超过 θ 时产生脉冲。
  • 使用二值化权重 w^ij ∈ {−1, 1} 和二值激活 z^i_t ∈ {0, 1},并采用突触后电位 x^j_t+1 ∈ {−1, 0, 1},以实现高效计算与内存节省。

实验结果

研究问题

  • RQ1动态阈值调节策略是否能改善二值化脉冲神经网络中的训练收敛速度与准确率?
  • RQ2与固定阈值训练相比,阈值退火在BSNN中能将死神经元数量减少多少?
  • RQ3一种随时间逐步提高阈值的暖启动策略,是否能在不使用全精度权重的前提下,平衡脉冲活动与动态范围?
  • RQ4阈值退火在具有不同输入稀疏性与时间动态特性的多样化数据集上的性能表现如何?
  • RQ5阈值退火是否能在保持极低内存占用与硬件效率的同时,使BSNN实现具有竞争力的准确率?

主要发现

  • 与固定阈值BSNN相比,阈值退火在SHD数据集上将死神经元数量减少了71%,显著提升了训练收敛性。
  • 在DVS128 Gesture数据集上,所提出的BSNN采用阈值退火后,仅使用98 Kbits的二值化权重即达到91.3%的准确率,优于使用8.4 Mbits全精度权重的网络(准确率为82.1%)。
  • 在CIFAR-10数据集上,该方法仅用12 Kbits的二值化权重即达到87.9%的准确率,超过使用794 Kbits全精度权重的NH模型(准确率为87.3%)。
  • 尽管仅使用二值化权重且内存开销极低,该方法在所有四个测试数据集(CIFAR-10、SVHN、DVS128 Gesture和SHD)上均实现了最先进性能。
  • 最终阈值 θ_γ 与稳态阈值 θ_∞ 的偏差始终控制在0.1%以内,因此可在推理阶段直接使用 θ_∞,无需重新训练或校准。
  • 脉冲活动分布显著改善:在SHD数据集中,采用阈值退火后,第一层和最后一层的死神经元比例均降至约20%,而固定阈值基线模型分别为55%和90%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。