[论文解读] Accurate and Efficient Event-based Semantic Segmentation Using Adaptive Spiking Encoder-Decoder Network
该论文提出了一种用于事件驱动语义分割的自适应脉冲编码-解码网络,通过分层神经架构搜索和一种新型双路脉冲空间自适应调制(SSAM)模块,增强了稀疏事件表示。在DDD17数据集上达到72.57%的MIoU,在DSEC-Semantic数据集上达到57.22%,性能优于最先进的人工神经网络(ANNs)4%,同时显著降低了计算和能耗成本。
Spiking neural networks (SNNs), known for their low-power, event-driven computation and intrinsic temporal dynamics, are emerging as promising solutions for processing dynamic, asynchronous signals from event-based sensors. Despite their potential, SNNs face challenges in training and architectural design, resulting in limited performance in challenging event-based dense prediction tasks compared to artificial neural networks (ANNs). In this work, we develop an efficient spiking encoder-decoder network (SpikingEDN) for large-scale event-based semantic segmentation tasks. To enhance the learning efficiency from dynamic event streams, we harness the adaptive threshold which improves network accuracy, sparsity and robustness in streaming inference. Moreover, we develop a dual-path Spiking Spatially-Adaptive Modulation module, which is specifically tailored to enhance the representation of sparse events and multi-modal inputs, thereby considerably improving network performance. Our SpikingEDN attains a mean intersection over union (MIoU) of 72.57\% on the DDD17 dataset and 58.32\% on the larger DSEC-Semantic dataset, showing competitive results to the state-of-the-art ANNs while requiring substantially fewer computational resources. Our results shed light on the untapped potential of SNNs in event-based vision applications. The source code will be made publicly available.
研究动机与目标
- 为解决事件视觉中密集预测任务(如语义分割)缺乏高性能SNN的问题。
- 克服SNN在架构和训练方面面临的挑战,包括与现代深度学习组件(如归一化和注意力机制)的不兼容性。
- 设计一种低功耗、高效的SNN架构,使其在大规模事件驱动数据集上的性能达到或超过最先进的ANNs。
- 探究自适应阈值机制和MFI兼容模块在提升SNN在稀疏、动态事件流上性能方面的有效性。
- 证明SNN可在保持超低计算和能耗成本的同时,优于ANNs完成复杂视觉任务。
提出的方法
- 所提出的网络采用分层搜索方法,在单元和层两个层级上优化编码器架构,通过15个周期的迭代双层优化提升性能。
- 在脉冲神经元中引入自适应阈值机制,以动态调节对高动态范围事件输入的激活,增强时间响应能力。
- 设计了一种双路脉冲空间自适应调制(SSAM)模块,以改善稀疏事件的表征,其操作兼容无乘法推理(MFI)。
- 使用替代梯度反向传播训练网络,优化器为Adam,学习率通过Poly策略衰减,并在架构搜索后进行通道扩展。
- 在纯事件输入和混合事件+帧输入上对模型进行评估,结果表明灰度图像可提升边缘和小物体检测能力。
- 架构搜索在20个周期内进行,使用四个随机种子,基于关键检查点的验证MIoU选择表现最佳的架构。
实验结果
研究问题
- RQ1SNN能否在事件驱动语义分割中实现最先进性能,甚至超越先进的ANNs?
- RQ2脉冲神经元中的自适应阈值机制如何提升在动态、稀疏事件流上的性能?
- RQ3MFI兼容的双路SSAM模块在多大程度上能增强SNN对稀疏事件的表征能力?
- RQ4分层神经架构搜索能否在不牺牲效率的前提下,有效优化SNN用于密集预测任务?
- RQ5引入灰度图像是否能提升语义分割精度,特别是对小物体或精细结构物体?
主要发现
- 所提出的SNN在DDD17数据集上达到72.57%的平均交并比(MIoU),比最佳性能的ANNs高出4%。
- 在更大、更高分辨率的DSEC-Semantic数据集上,SNN达到57.22%的MIoU,比最先进的基于ANN的方法高出4%。
- 与非优化基线相比,架构搜索过程使网络性能提升约19%,且在多个随机种子下均保持一致增益。
- 引入灰度图像使'person'和'vehicle'类别的IoU分别提升35.82%和28.57%,显著改善了边缘检测效果。
- 该网络消耗的计算操作显著更少,潜在能耗成本也更低,证实其在低功耗应用中的适用性。
- 本研究首次证明,SNN可在复杂、大规模事件驱动语义分割任务中超越ANNs。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。