[论文解读] Graph-Based Object Classification for Neuromorphic Vision Sensing
本文提出了一种基于图的神经形态视觉传感器(NVS)脉冲事件表示方法,并引入残差图卷积神经网络(RG-CNN)实现端到端的目标分类。通过将时空脉冲模式建模为图结构,该方法在计算量仅为ResNet50的1/5的情况下实现了最先进精度,同时构建了一个包含10万张样本的真实世界NVS数据集,用于美国手语字母的基准测试。
Neuromorphic vision sensing (NVS)\ devices represent visual information as sequences of asynchronous discrete events (a.k.a., ``spikes'') in response to changes in scene reflectance. Unlike conventional active pixel sensing (APS), NVS allows for significantly higher event sampling rates at substantially increased energy efficiency and robustness to illumination changes. However, object classification with NVS streams cannot leverage on state-of-the-art convolutional neural networks (CNNs), since NVS does not produce frame representations. To circumvent this mismatch between sensing and processing with CNNs, we propose a compact graph representation for NVS. We couple this with novel residual graph CNN architectures and show that, when trained on spatio-temporal NVS data for object classification, such residual graph CNNs preserve the spatial and temporal coherence of spike events, while requiring less computation and memory. Finally, to address the absence of large real-world NVS datasets for complex recognition tasks, we present and make available a 100k dataset of NVS recordings of the American sign language letters, acquired with an iniLabs DAVIS240c device under real-world conditions.
研究动机与目标
- 为解决神经形态视觉传感(NVS)数据缺乏帧结构、不适用于传统CNN的问题,填补有效深度学习方法的空白。
- 开发一种紧凑、高效且可端到端训练的NVS脉冲事件表示方法,以保持时空一致性。
- 解决复杂识别任务中大规模、真实世界标注的NVS数据集稀缺的问题。
- 通过在异步事件流上应用基于图的深度学习,实现高准确率、低复杂度的目标分类。
提出的方法
- 将NVS脉冲事件表示为动态图,其中节点对应空间位置和时间戳,边编码时空邻近性。
- 设计一种新型残差图卷积神经网络(RG-CNN)架构,可处理图结构数据,具备可学习滤波器和跳跃连接。
- 采用B样条基函数进行图卷积,确保局部支持并减少FLOPs,且与卷积核大小无关。
- 在每次图卷积后应用最大池化层,以降低图的规模,同时保留结构信息。
- 采用两阶段训练流程:首先在合成事件数据集上进行预训练,然后在真实世界NVS数据上进行微调。
- 通过空间分箱和时间聚合从脉冲流构建事件图像,以实现与传统CNN的对比。
实验结果
研究问题
- RQ1基于图的表示能否有效建模神经形态视觉传感器(NVS)脉冲事件的时空动态特性,以实现目标分类?
- RQ2残差图CNN架构在NVS数据上是否能在提升准确率的同时降低计算成本,优于传统CNN和现有事件驱动方法?
- RQ3图卷积网络的深度和卷积核大小如何影响性能与模型复杂度?
- RQ4大规模、真实世界且标注良好的NVS数据集能否提升目标分类模型的泛化能力并促进基准测试?
- RQ5与标准CNN(如ResNet50)相比,所提方法在应用于NVS数据时,计算量和内存使用量减少了多少?
主要发现
- 所提出的RG-CNN在N-Caltech101数据集上达到65.7%的top-1准确率,优于相同输入分辨率下的ResNet50(63.7%),且仅需0.79 GFLOPs。
- 具有四层图卷积(D=4)的模型在准确率(63.0%)与复杂度(0.39 GFLOPs)之间取得最佳平衡,优于更深但FLOPs更高的模型。
- 图卷积中核大小为5时在测试的核大小范围(2–6)内取得最高准确率(63.0%),且模型大小仅中等增加(18.81 MB)。
- 所提图方法的FLOPs仅为ResNet50的1/5,尽管准确率更高,仍展现出显著的效率优势。
- 新构建的10万张样本的美国手语字母NVS数据集是在真实世界条件下采集的,是迄今最大的公开真实世界标注NVS数据集。
- RG-CNN在多个基准测试中(包括N-Caltech101和新的ASL数据集)表现优于或匹配最先进方法,同时保持了较低的推理成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。