[论文解读] EventCLIP: Adapting CLIP for Event-based Object Recognition
EventCLIP 通过将事件流转换为二维网格表示并引入时间 Transformer 适配器来优化视觉和文本特征,将 CLIP 视觉-语言模型适配于零样本和少样本事件基础物体识别。它在 N-Caltech、N-Cars 和 N-ImageNet 上实现了最先进性能,在少样本和微调设置下优于现有方法,并通过模型集成和伪标签法实现了鲁棒分类与无标签学习。
Recent advances in zero-shot and few-shot classification heavily rely on the success of pre-trained vision-language models (VLMs) such as CLIP. Due to a shortage of large-scale datasets, training such models for event camera data remains infeasible. Thus, adapting existing VLMs across modalities to event vision is an important research challenge. In this work, we introduce EventCLIP, a novel approach that utilizes CLIP for zero-shot and few-shot event-based object recognition. We first generalize CLIP's image encoder to event data by converting raw events to 2D grid-based representations. To further enhance performance, we propose a feature adapter to aggregate temporal information over event frames and refine text embeddings to better align with the visual inputs. We evaluate EventCLIP on N-Caltech, N-Cars, and N-ImageNet datasets, achieving state-of-the-art few-shot performance. When fine-tuned on the entire dataset, our method outperforms all existing event classifiers. Moreover, we explore practical applications of EventCLIP including robust event classification and label-free event recognition, where our approach surpasses previous baselines designed specifically for these tasks.
研究动机与目标
- 在缺乏大规模事件-文本数据集的情况下,实现事件基础视觉中的零样本和少样本物体识别。
- 弥合预训练 CLIP(专为图像设计)与异步事件数据之间的模态差距。
- 通过时间聚合与文本嵌入适配,优化 CLIP 特征,提升事件基础识别性能。
- 探索实际应用,如通过模型集成实现鲁棒分类,以及通过伪标签法实现无监督学习。
提出的方法
- 通过时间窗划分将原始事件流转换为基于 2D 网格的帧,以兼容 CLIP 的图像输入。
- 使用 CLIP 的预训练图像和文本编码器,分别从事件帧和类别名称提示中提取特征。
- 引入基于 Transformer 的特征适配器,以跨事件帧聚合时间信息并优化视觉特征。
- 微调文本嵌入作为分类器权重,以提升与事件基础视觉特征的对齐性。
- 在 EventCLIP 与现有事件分类器之间进行模型集成,以增强分布外数据的鲁棒性。
- 利用 EventCLIP 生成高质量伪标签,用于无标签和半监督学习设置下的自训练。
实验结果
研究问题
- RQ1尽管缺乏事件-文本数据集,预训练 CLIP 是否可有效适配于零样本事件基础物体识别?
- RQ2如何有效聚合异步事件流中的时间信息,以提升 CLIP 在事件数据上的性能?
- RQ3CLIP 的预训练知识是否能增强现有事件基础分类器在分布偏移下的鲁棒性?
- RQ4EventCLIP 是否可用于生成可靠伪标签,以支持事件基础视觉中的无监督学习?
主要发现
- EventCLIP 在 N-Caltech、N-Cars 和 N-ImageNet 上实现了最先进少样本性能,优于现有事件基础分类器。
- 在完整数据集上微调时,EventCLIP 在 N-ImageNet 上超越了所有现有事件分类器。
- 将 0-样本 EventCLIP 与 DiST 集成后,N-ImageNet 鲁棒性子集上的准确率提升超过 5%,优于与完全训练的 DiST 集成。
- 仅用每类 20 个样本(训练数据的 2% 以下)训练的 EventCLIP,在大多数鲁棒性子集上优于 Ev-TTA 的在线版本。
- 在 100-样本微调(数据的 8%)下,EventCLIP 超过 Ev-TTA 的离线版本,在鲁棒性方面达到新的最先进结果。
- 在无标签学习中,EventCLIP 配合基于一致性的标签法在 N-ImageNet(Mini)上达到 35.26% 的准确率,较 Ev-LaFOR 的 31.28% 提升 4%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。