Skip to main content
QUICK REVIEW

[论文解读] Attention Mechanisms for Object Recognition with Event-Based Cameras

Marco Cannici, Marco Ciccone|arXiv (Cornell University)|Jul 25, 2018
Advanced Memory and Neural Computing参考文献 33被引用 4
一句话总结

本文针对事件相机提出两种用于目标识别的注意力机制:一种是通过追踪事件活动来定位感兴趣区域的算法方法,另一种是基于可微DRAW的注意力模型,可自适应地从重建帧中提取显著区域。两种方法均在基线模型Phased LSTM的基础上提升了平移与尺度不变性,其中可微方法在N-Caltech101和CIFAR10-DVS等多尺度数据集上表现出更优的泛化能力。

ABSTRACT

Event-based cameras are neuromorphic sensors capable of efficiently encoding visual information in the form of sparse sequences of events. Being biologically inspired, they are commonly used to exploit some of the computational and power consumption benefits of biological vision. In this paper we focus on a specific feature of vision: visual attention. We propose two attentive models for event based vision: an algorithm that tracks events activity within the field of view to locate regions of interest and a fully-differentiable attention procedure based on DRAW neural model. We highlight the strengths and weaknesses of the proposed methods on four datasets, the Shifted N-MNIST, Shifted MNIST-DVS, CIFAR10-DVS and N-Caltech101 collections, using the Phased LSTM recognition network as a baseline reference model obtaining improvements in terms of both translation and scale invariance.

研究动机与目标

  • 提升基于事件的物体识别中的平移与尺度不变性,该问题在传统模型如Phased LSTM中仍具挑战性。
  • 设计注意力机制,聚焦于事件流中的显著区域,而无需依赖帧重建,以保持脉冲传感的效率。
  • 开发一种完全可微的注意力机制,兼容端到端训练,克服非可微脉冲网络的局限性。
  • 在多样化的数据集(包括噪声与复杂场景)上评估所提方法,以评估其鲁棒性与泛化能力。
  • 探索完全基于事件的架构,避免帧重建的同时通过事件驱动的注意力机制保持性能。

提出的方法

  • 一种算法性注意力机制通过监测时空事件活动,从重建帧中提取局部区域,提升平移不变性。
  • 一种基于DRAW模型的可微注意力机制被适配于事件输入,利用循环网络预测二维高斯滤波器参数以提取区域。
  • N-DRAW变体仅使用事件序列预测注意力滤波器,实现无需依赖预计算帧的端到端训练。
  • Leaky Frame Integrator通过时间平均的漏斗积分过程从事件中重建帧,以保留时间动态同时减少噪声。
  • Phased LSTM网络作为基线,注意力模块被集成以选择性地处理相关事件序列与空间区域。
  • 注意力机制根据物体尺度动态调整感受野大小,实现对小物体或大物体的自适应缩放。

实验结果

研究问题

  • RQ1基于事件活动追踪的算法机制是否能提升基于事件的物体识别中的平移不变性?
  • RQ2像DRAW这样的可微注意力机制是否能有效适配于事件数据,以增强尺度不变性?
  • RQ3在多尺度与噪声数据集上,基于注意力的模型与基线Phased LSTM相比,在准确率与鲁棒性方面表现如何?
  • RQ4事件驱动的注意力机制在多大程度上可不依赖帧重建运行,从而保持脉冲传感的效率?
  • RQ5在背景与前景事件难以分离的高噪声环境中,当前注意力机制存在哪些局限性?

主要发现

  • 算法性注意力机制在基线Phased LSTM基础上提升了平移不变性,尤其在物体位置变化较大的数据集中表现更优。
  • N-DRAW模型在大多数数据集上的性能与基于区域的方法相当,证明了端到端可训练事件注意力机制的可行性。
  • 在N-Caltech101与CIFAR10-DVS数据集中,两种所提模型均优于基线Phased LSTM,展现出更强的泛化能力与鲁棒性。
  • N-DRAW模型通过自适应调整区域大小(放大小物体、保持大物体)实现了更好的尺度不变性,提升了特征一致性。
  • 尽管性能有所提升,但模型未达到当前最先进准确率(如CIFAR10-DVS上为65.43%),主要受限于在噪声场景中难以区分前景与背景。
  • 性能差距归因于训练数据不足,以及在脉冲领域缺乏预训练特征提取器时,学习有效滤波器变换的困难。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。