Skip to main content
QUICK REVIEW

[论文解读] Deep Spiking Convolutional Neural Network for Single Object Localization Based On Deep Continuous Local Learning

Sami Barchid, José Mennesson|arXiv (Cornell University)|May 12, 2021
Advanced Memory and Neural Computing参考文献 25被引用 7
一句话总结

本文提出了一种基于DECOLLE框架的深度脉冲卷积神经网络(DCSNN),用于灰度图像中的单对象定位,采用带有代理梯度的监督局部学习。其在Oxford-IIIT-Pet数据集上实现了63.2%的mIoU,证明了SNN在复杂计算机视觉任务中(超越简单分类)训练的可行性。

ABSTRACT

With the advent of neuromorphic hardware, spiking neural networks can be a good energy-efficient alternative to artificial neural networks. However, the use of spiking neural networks to perform computer vision tasks remains limited, mainly focusing on simple tasks such as digit recognition. It remains hard to deal with more complex tasks (e.g. segmentation, object detection) due to the small number of works on deep spiking neural networks for these tasks. The objective of this paper is to make the first step towards modern computer vision with supervised spiking neural networks. We propose a deep convolutional spiking neural network for the localization of a single object in a grayscale image. We propose a network based on DECOLLE, a spiking model that enables local surrogate gradient-based learning. The encouraging results reported on Oxford-IIIT-Pet validates the exploitation of spiking neural networks with a supervised learning approach for more elaborate vision tasks in the future.

研究动机与目标

  • 探索使用深度脉冲神经网络(SNN)执行复杂计算机视觉任务(超越简单分类)的可行性。
  • 弥合能效高的类脑硬件与现代视觉任务(如目标定位)之间的差距。
  • 验证监督局部学习规则(如DECOLLE)可应用于SNN,以实现视觉任务中的层次化特征学习。
  • 建立基于SNN的单对象定位的可行性概念验证,使用静态、脉冲编码图像。
  • 研究SNN在未来事件驱动视觉系统中的潜力,特别是结合动态传感器时。

提出的方法

  • 该方法采用基于DECOLLE脉冲模型的深度编码-解码架构,通过代理梯度实现局部、类似反向传播的训练。
  • SNN使用平滑L1损失函数,配合AdaMax优化器,学习率为1e-9,在100个周期内进行训练。
  • 输入图像被转换为灰度图,并通过T个时间步的脉冲频率编码,将静态数据表示为脉冲格式。
  • 最终预测结果从输出层最后一时间步的输出中选取,利用深层网络提取的层次化表征。
  • 数据增强包括随机水平翻转和亮度调整,以提升泛化能力。
  • 网络采用局部突触可塑性规则,基于误差信号更新权重,避免全局反向传播。

实验结果

研究问题

  • RQ1使用监督局部学习规则训练的深度脉冲神经网络能否执行复杂视觉任务(如目标定位)?
  • RQ2DECOLLE框架在静态图像数据上结合脉冲编码时,对SNN训练的有效性如何?
  • RQ3与标准深度学习模型相比,SNN在目标定位任务上的性能表现如何?
  • RQ4数据不平衡与输入编码方式对SNN在目标定位中性能的影响如何?
  • RQ5能否将基于静态图像训练的SNN扩展至未来事件驱动的异步视觉数据?

主要发现

  • 所提出的DCSNN在Oxford-IIIT-Pet测试集上实现了63.2%的平均交并比(mIoU),验证了SNN在目标定位任务中应用的可行性。
  • 定性结果表明,边界框预测整体准确度较高(mIoU为55–70%),但小物体或位于背景中的物体性能下降。
  • 模型在罕见和困难样本上表现不佳,可能由于数据集中更倾向于近距离宠物图像,导致数据不平衡。
  • 从分割掩码转换为边界框的输出策略引入了信息损失,影响了坐标预测的准确性。
  • 本研究证实,采用局部学习规则(如DECOLLE)的监督SNN可应用于复杂视觉任务,标志着向功能化SNN目标检测迈出第一步。
  • 未来工作应探索事件相机,以利用SNN的异步、稀疏特性,进一步提升能效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。