[论文解读] Efficient Event-Based Object Detection: A Hybrid Neural Network with Spatial and Temporal Attention
该论文提出了一种结合空间与时间注意力机制的混合SNN-ANN主干网络,用于高效处理事件数据的物体检测,利用脉冲神经网络(SNN)实现低功耗、高时间分辨率的预处理,同时利用人工神经网络(ANN)进行高精度特征学习。该方法在性能上达到与纯ANN基线相当的最先进水平,同时显著降低了参数量与能耗,通过在英特尔Loiih 2硬件上部署得到验证,实现1.7W功耗下的亚实时推理。
Event cameras offer high temporal resolution and dynamic range with minimal motion blur, making them promising for robust object detection. While Spiking Neural Networks (SNNs) on neuromorphic hardware are often considered for energy-efficient and low latency event-based data processing, they often fall short of Artificial Neural Networks (ANNs) in accuracy and flexibility. Here, we introduce Attention-based Hybrid SNN-ANN backbones for event-based object detection to leverage the strengths of both SNN and ANN architectures. A novel Attention-based SNN-ANN bridge module captures sparse spatial and temporal relations from the SNN layer and converts them into dense feature maps for the ANN part of the backbone. Additionally, we present a variant that integrates DWConvL-STMs to the ANN blocks to capture slower dynamics. This multi-timescale network combines fast SNN processing for short timesteps with long-term dense RNN processing, effectively capturing both fast and slow dynamics. Experimental results demonstrate that our proposed method surpasses SNN-based approaches by significant margins, with results comparable to existing ANN and RNN-based methods. Unlike ANN-only networks, the hybrid setup allows us to implement the SNN blocks on digital neuromorphic hardware to investigate the feasibility of our approach. Extensive ablation studies and implementation on neuromorphic hardware confirm the effectiveness of our proposed modules and architectural choices. Our hybrid SNN-ANN architectures pave the way for ANN-like performance at a drastically reduced parameter, latency, and power budget.
研究动机与目标
- 为高效处理稀疏、高时间分辨率的事件数据以实现物体检测,同时保持高精度。
- 将脉冲神经网络(SNN)的能效优势与人工神经网络(ANN)的优越学习能力相结合。
- 设计一种新型基于注意力机制的桥接模块,将稀疏的SNN特征有效转换为适合ANN处理的密集高层表征。
- 通过在数字类脑硬件(英特尔Loihi 2)上实现SNN主干网络,验证其硬件可行性与能效表现。
- 通过混合SNN-ANN架构实现接近ANN级别的性能,同时大幅降低参数量与功耗。
提出的方法
- 所提出的架构采用混合SNN-ANN主干网络,其中SNN模块以高时间分辨率和低功耗处理原始事件数据。
- 一种基于注意力机制的SNN-ANN桥接模块将稀疏的SNN输出转换为适合ANN部分处理的密集特征图,包含两个组件:事件率空间(ERS)注意力与空间感知时间(SAT)注意力。
- ERS注意力突出显示事件活动较高的空间区域,提升空间特征表征能力。
- SAT注意力通过关注随时间变化的不规则时空模式,建模稀疏事件流中的时间依赖关系。
- 网络采用替代梯度反向传播进行端到端训练,使误差能够通过SNN组件反向传播。
- SNN模块被量化为int8,并与批归一化及LIF神经元动力学融合,以实现在英特尔Loihi 2上的部署,同时保持精度并实现低延迟推理。
实验结果
研究问题
- RQ1混合SNN-ANN架构是否能在保持SNN在能效与时间分辨率方面优势的同时,实现与ANN相当的物体检测性能?
- RQ2所提出的基于注意力机制的SNN-ANN桥接模块在捕捉事件数据中稀疏的空间与时间关系方面效果如何?
- RQ3在精度与计算效率之间,SNN与ANN模块数量的最优平衡点在哪里?
- RQ4SNN主干是否能高效部署在类脑硬件上,实现极低精度损失与亚实时延迟?
- RQ5当在数字类脑芯片(如Loihi 2)上实现时,该混合架构的功耗与延迟特性如何?
主要发现
- 所提出的混合SNN-ANN模型在mAP(.5)上达到0.61,mAP(.75)为0.34,mAP(.5:.05:.95)为0.35,优于基线混合模型与仅SNN方法,且与最先进的基于ANN的方法性能相当。
- 4-4配置(四个SNN模块与四个ANN模块)实现了最佳平衡,性能与3-5配置相当,但计算开销更低。
- SNN模块在英特尔Loihi 2上成功部署,功耗为1.7W ± 0.1W,每步延迟为1.9ms ± 0.8ms,快于实时(每步5ms)。
- 通过int8量化并结合权重缩放与输入融合,精度得以保持,int8配置的mAP(.5)为0.349,float16配置为0.348,证明了硬件兼容性。
- 消融实验表明,ERS与SAT注意力模块均显著提升性能,其中SAT注意力在处理稀疏事件输入方面尤为有效。
- 硬件实现表明,SNN主干支持亚实时、低功耗推理,在能效方面优于NVIDIA Jetson Orin Nano等商用边缘设备。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。