[论文解读] Convolutional Spiking Neural Networks for Spatio-Temporal Feature Extraction
该论文提出了一种新型深度脉冲神经网络(STS-ResNet),采用改进的通过时间反向传播方法,实现了事件数据中有效的时空特征提取。该方法在多个基准数据集上达到最先进性能,包括在NMNIST上实现99.6%的准确率,在DVS-CIFAR10上达到69.2%,同时通过基于二值脉冲的计算和残差连接,保持了较低的计算成本和内存占用。
Spiking neural networks (SNNs) can be used in low-power and embedded systems (such as emerging neuromorphic chips) due to their event-based nature. Also, they have the advantage of low computation cost in contrast to conventional artificial neural networks (ANNs), while preserving ANN's properties. However, temporal coding in layers of convolutional spiking neural networks and other types of SNNs has yet to be studied. In this paper, we provide insight into spatio-temporal feature extraction of convolutional SNNs in experiments designed to exploit this property. The shallow convolutional SNN outperforms state-of-the-art spatio-temporal feature extractor methods such as C3D, ConvLstm, and similar networks. Furthermore, we present a new deep spiking architecture to tackle real-world problems (in particular classification tasks) which achieved superior performance compared to other SNN methods on NMNIST (99.6%), DVS-CIFAR10 (69.2%) and DVS-Gesture (96.7%) and ANN methods on UCF-101 (42.1%) and HMDB-51 (21.5%) datasets. It is also worth noting that the training process is implemented based on variation of spatio-temporal backpropagation explained in the paper.
研究动机与目标
- 研究卷积脉冲神经网络(SNNs)在传统人工神经网络(ANNs)之外的时空特征提取能力。
- 解决由于通过时间反向传播(BPTT)方法中梯度消失导致训练深层SNN的挑战。
- 开发一种训练方法,使更深的SNN架构能够在真实世界事件数据集上超越现有SNN和ANN模型。
- 证明SNN在时间数据处理中可实现更优性能,且相比ANN具有显著更低的计算和内存成本。
提出的方法
- 提出一种基于BPTT的改进训练方法,在应用基于梯度的反向传播前,先使用非脉冲权重对网络进行预训练,以缓解梯度消失问题。
- 引入受ResNet启发的跳跃连接,以稳定更深SNN架构的训练过程。
- 采用高斯近似方法处理狄拉克δ函数的导数,以实现梯度在脉冲事件中的流动。
- 采用10帧的时间窗口进行时序处理,将每帧内的事件序列拼接以保留时空动态特性。
- 在分类任务中使用Adam和SGD优化器,结合二元交叉熵损失;采用基于阈值的脉冲生成机制,衰减因子为0.5–0.8,具体取决于数据集。
- 禁用静息机制以提升准确率,接受一定程度的稀疏性损失以换取更好的性能。
实验结果
研究问题
- RQ1卷积SNN能否在事件数据中有效提取时空特征,其性能与传统ANN相比如何?
- RQ2哪些训练策略能有效帮助深层SNN克服通过时间反向传播中的梯度消失问题?
- RQ3所提出的架构在真实世界事件数据集上的表现如何,相较于当前最先进SNN和ANN模型?
- RQ4SNN在多大程度上能以显著降低的内存和计算成本实现高准确率,相比ANN?
主要发现
- 浅层卷积SNN在合成时空特征提取任务中优于C3D、ConvLSTM等网络。
- 所提出的STS-ResNet架构在NMNIST上达到99.6%的准确率,超越了以往SOTA SNN方法,并在该基准上与ANN性能相当或更优。
- 在DVS-CIFAR10上,模型达到69.2%的准确率,创下SNN在该数据集上的新SOTA纪录。
- 在DVS-Gesture上,模型达到96.7%的准确率,展示了在真实世界手势识别任务中的强大性能。
- 在UCF-101上,模型达到42.1%的准确率,优于SNN和ANN基线模型(如ResNet18+随机初始化为42.4%),在动作识别任务中表现具有竞争力。
- 在HMDB-51上,模型达到21.5%的准确率,显著优于ResNet18+随机初始化基线(17.1%),展现出在具有挑战性的时序动作识别任务中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。