[论文解读] N-ImageNet: Towards Robust, Fine-Grained Object Recognition with Event Cameras
本文介绍了 N-ImageNet,这是一个大规模、细粒度的事件相机数据集,包含 178 万个样本,涵盖 1,000 个 ImageNet 类别,通过在显示器播放 ImageNet 图像时移动事件相机采集而成。研究证明,在 N-ImageNet 上进行预训练可显著提升基于事件的分类器性能与泛化能力,尤其在少样本设置下表现突出;同时提出了 DiST——一种新型事件表征方法,通过应用折扣与排序的时间戳,增强了对运动和光照变化的鲁棒性,在不同环境条件下对 N-ImageNet 变体的性能优于现有方法。
We introduce N-ImageNet, a large-scale dataset targeted for robust, fine-grained object recognition with event cameras. The dataset is collected using programmable hardware in which an event camera consistently moves around a monitor displaying images from ImageNet. N-ImageNet serves as a challenging benchmark for event-based object recognition, due to its large number of classes and samples. We empirically show that pretraining on N-ImageNet improves the performance of event-based classifiers and helps them learn with few labeled data. In addition, we present several variants of N-ImageNet to test the robustness of event-based classifiers under diverse camera trajectories and severe lighting conditions, and propose a novel event representation to alleviate the performance degradation. To the best of our knowledge, we are the first to quantitatively investigate the consequences caused by various environmental conditions on event-based object recognition algorithms. N-ImageNet and its variants are expected to guide practical implementations for deploying event-based object recognition algorithms in the real world.
研究动机与目标
- 为解决基于事件的物体识别领域缺乏大规模、细粒度数据集的问题,该问题阻碍了鲁棒且可泛化算法的发展。
- 创建一个基准,以实现在不同环境条件(如变化的相机轨迹和光照水平)下对基于事件的分类器进行定量评估。
- 研究现有基于事件的识别模型在真实世界环境变化下的鲁棒性,揭示其对特定设置偏差的敏感性。
- 提出一种新型事件表征方法 DiST,以提升对外部变化(如运动模糊和照度变化)的鲁棒性。
- 将 N-ImageNet 及其变体确立为未来实际、真实世界中事件视觉系统部署研究的基础。
提出的方法
- N-ImageNet 通过程序化控制事件相机在显示 ImageNet 图像的 LCD 显示器前移动生成,确保在 1,000 个类别上获得一致且高质量的事件序列。
- 该数据集的结构支持基于事件的分类器预训练,共包含 1,781,167 个样本和 1,000 个细粒度类别,其规模与粒度均超过现有基准。
- 通过改变相机轨迹和光照条件(如调暗、闪烁)创建 N-ImageNet 的多个变体,以模拟真实世界中的环境变化。
- 提出 DiST(折扣排序时间戳图像)作为新型事件表征方法,对时间戳应用指数折扣并进行空间排序,以减少噪声并提升对运动速度变化的不变性。
- 通过在原始和变体 N-ImageNet 分割上评估模型性能,使用 top-1 准确率和 SSIM 衡量鲁棒性与表征一致性。
- 通过性能在不同变体间的退化程度量化鲁棒性,结果表明 DiST 相较于基线表征方法能最小化这种退化。

实验结果
研究问题
- RQ1在 N-ImageNet 上进行预训练如何影响基于事件的分类器的性能及其少样本泛化能力?
- RQ2在相机轨迹和光照条件变化时,基于事件的分类器性能退化程度如何?
- RQ3新型事件表征能否缓解环境变化导致的基于事件识别的性能退化?
- RQ4DiST 的不同组件——折扣与排序——在提升鲁棒性方面各自及协同发挥的作用如何?
- RQ5N-ImageNet 及其变体在在多大程度上可作为基于事件视觉系统鲁棒性评估的定量基准?
主要发现
- 在 N-ImageNet 上进行预训练可带来显著的性能提升,模型在原始 N-ImageNet 基准上达到 48.93% 的 top-1 准确率,显著优于同类任务的先前方法。
- 在标准基准上训练的基于事件的分类器在 N-ImageNet 变体上评估时表现出一致且严重的性能退化,表明其对训练条件存在强烈偏差。
- 所提出的 DiST 表征在所有 N-ImageNet 变体中均实现了最高的鲁棒性,其在环境变化下的准确率优于所有基线方法,包括排序时间面、DiT 和时间戳图像。
- DiST 在原始数据集与变体数据集之间表征的 SSIM(结构相似性)最高,表明其在外部变化下具有更优的内容一致性。
- 消融研究证实,DiST 中的折扣与排序均为必要组件:移除任一成分均导致性能显著下降,其中折扣对一致性贡献更大,排序对泛化性贡献更大。
- N-ImageNet 及其变体首次为基于事件的物体识别提供了鲁棒性评估的定量基准,支持对算法偏差与改进的系统性分析。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。