Skip to main content
QUICK REVIEW

[论文解读] Masked Event Modeling: Self-Supervised Pretraining for Event Cameras

Sinja Klenk, David Bonello|arXiv (Cornell University)|Dec 20, 2022
Advanced Memory and Neural Computing被引用 4
一句话总结

本文提出掩码事件建模(MEM),一种用于事件相机的自监督预训练框架,通过视觉Transformer主干网络重建被掩码的事件序列。通过在大规模无标签事件数据上进行预训练,MEM在N-ImageNet、N-Cars和N-Caltech101上实现了最先进性能,甚至优于在真实世界事件数据上进行的监督RGB预训练,展现出出色的标签效率和语义分割任务中的泛化能力。

ABSTRACT

Event cameras asynchronously capture brightness changes with low latency, high temporal resolution, and high dynamic range. However, annotation of event data is a costly and laborious process, which limits the use of deep learning methods for classification and other semantic tasks with the event modality. To reduce the dependency on labeled event data, we introduce Masked Event Modeling (MEM), a self-supervised framework for events. Our method pretrains a neural network on unlabeled events, which can originate from any event camera recording. Subsequently, the pretrained model is finetuned on a downstream task, leading to a consistent improvement of the task accuracy. For example, our method reaches state-of-the-art classification accuracy across three datasets, N-ImageNet, N-Cars, and N-Caltech101, increasing the top-1 accuracy of previous work by significant margins. When tested on real-world event data, MEM is even superior to supervised RGB-based pretraining. The models pretrained with MEM are also label-efficient and generalize well to the dense task of semantic image segmentation.

研究动机与目标

  • 减少深度学习任务中对昂贵且耗时的事件数据标注的依赖。
  • 开发一种自监督预训练框架,利用无标签事件序列的时间和空间结构。
  • 提升下游事件视觉任务(如图像分类和语义分割)的性能。
  • 在不同事件数据集和真实世界录制数据中实现标签效率高且泛化能力强。
  • 在事件相机基准测试中超越现有监督和自监督方法,包括基于RGB的预训练方法。

提出的方法

  • 该方法采用掩码自编码目标,随机掩码事件序列的时间和空间片段,模型负责重建这些片段。
  • 视觉Transformer(ViT)主干网络处理事件数据,事件数据以带有时间戳极性事件的张量形式表示。
  • 模型在来自不同事件相机和环境的大量多样化无标签事件记录上进行预训练。
  • 在预训练过程中,模型通过多头自注意力机制关注周围上下文,以预测缺失的事件片段。
  • 预训练完成后,模型在下游任务上使用少量标注数据进行微调,从而实现强大的少样本和零样本性能。
  • 该框架通过在掩码事件序列上使用重建损失端到端训练,实现在无需人工标注标签的情况下进行表征学习。

实验结果

研究问题

  • RQ1在无标签事件数据上进行自监督预训练是否能提升下游事件视觉任务的性能?
  • RQ2MEM与在真实世界事件数据上进行的监督RGB预训练相比表现如何?
  • RQ3MEM在不同事件数据集和下游任务中的泛化程度如何?
  • RQ4MEM在低数据场景下的标签效率如何?
  • RQ5通过掩码重建事件序列是否能在无监督情况下学习到有意义的时空表征?

主要发现

  • MEM在N-ImageNet、N-Cars和N-Caltech101上实现了最先进性能,显著优于先前方法。
  • 在真实世界事件数据上,MEM的分类准确率超过监督RGB预训练,展现出更优的域泛化能力。
  • 该模型表现出强大的标签效率,在微调阶段仅使用少量标注数据即可实现高性能。
  • MEM在密集预测任务中泛化良好,在语义图像分割任务上仅需极少调整即可取得优异结果。
  • 在多样化无标签事件记录上进行预训练,可获得鲁棒表征,有效迁移至不同数据集和任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。