[논문 리뷰] EventCLIP: Adapting CLIP for Event-based Object Recognition
EventCLIP는 이벤트 스트림을 2차원 격자 표현으로 변환하고 시간적 Transformer 어댑터를 도입하여 시각-언어 모델 CLIP을 이벤트 기반 객체 인식에 적응시켜 zero-shot 및 few-shot 인식을 가능하게 한다. N-Caltech, N-Cars, N-ImageNet에서 최신 기술 수준의 성능을 달성하며, few-shot 및 미세조정 설정에서 기존 방법들을 능가하고, 모델 앙상블 및 가짜 레이블링을 통한 강건한 분류 및 레이블 없음 학습을 가능하게 한다.
Recent advances in zero-shot and few-shot classification heavily rely on the success of pre-trained vision-language models (VLMs) such as CLIP. Due to a shortage of large-scale datasets, training such models for event camera data remains infeasible. Thus, adapting existing VLMs across modalities to event vision is an important research challenge. In this work, we introduce EventCLIP, a novel approach that utilizes CLIP for zero-shot and few-shot event-based object recognition. We first generalize CLIP's image encoder to event data by converting raw events to 2D grid-based representations. To further enhance performance, we propose a feature adapter to aggregate temporal information over event frames and refine text embeddings to better align with the visual inputs. We evaluate EventCLIP on N-Caltech, N-Cars, and N-ImageNet datasets, achieving state-of-the-art few-shot performance. When fine-tuned on the entire dataset, our method outperforms all existing event classifiers. Moreover, we explore practical applications of EventCLIP including robust event classification and label-free event recognition, where our approach surpasses previous baselines designed specifically for these tasks.
연구 동기 및 목표
- 대규모 이벤트-텍스트 데이터셋이 확보되지 않은 이벤트 기반 시각에서 zero-shot 및 few-shot 객체 인식을 가능하게 하기 위해.
- 사전 훈련된 CLIP(이미지 전용으로 설계됨)과 이방향 이벤트 데이터 간의 모odal 갭을 메우기 위해.
- 시간적 집계와 텍스트 임베딩 적응을 통해 CLIP 특징을 개선하여 이벤트 기반 인식 성능을 향상시키기 위해.
- 모델 앙상블과 가짜 레이블링을 통한 비지도 학습을 포함한 실용적 응용을 탐색하기 위해.
제안 방법
- 이벤트 스트림을 시간 윈도우로 분할하여 2차원 격자 기반 프레임으로 변환함으로써 CLIP의 이미지 입력과의 호환성을 확보한다.
- CLIP의 사전 훈련된 이미지 및 텍스트 인코더를 사용하여 이벤트 프레임과 클래스명 프롬프트로부터 특징을 추출한다.
- 이벤트 프레임 간의 시간적 정보를 집계하고 시각적 특징을 개선하기 위해 Transformer 기반 특징 어댑터를 도입한다.
- 이벤트 기반 시각적 특징과의 정렬을 향상시키기 위해 텍스트 임베딩을 분류기 가중치로 미세조정한다.
- 분포 이탈 데이터에 대한 강건성을 향상시키기 위해 EventCLIP와 기존 이벤트 분류기 간의 모델 앙상블을 적용한다.
- EventCLIP를 사용하여 자기학습을 위한 고품질의 가짜 레이블을 생성함으로써 레이블 없음 및 준지도 학습 설정에서 활용한다.
실험 결과
연구 질문
- RQ1이벤트-텍스트 데이터셋이 부족한 상황에서도 사전 훈련된 CLIP이 효과적으로 zero-shot 이벤트 기반 객체 인식에 적응될 수 있는가?
- RQ2비동기적 이벤트 스트림에서 시간 정보를 효과적으로 집계하여 CLIP의 이벤트 데이터 성능을 향상시킬 수 있는가?
- RQ3CLIP의 사전 훈련된 지식이 분포 이탈 상황에서 기존 이벤트 기반 분류기의 강건성을 향상시킬 수 있는가?
- RQ4EventCLIP를 사용하여 이벤트 기반 시각에서 비지도 학습을 위한 신뢰할 수 있는 가짜 레이블을 생성할 수 있는가?
주요 결과
- EventCLIP는 N-Caltech, N-Cars, N-ImageNet에서 최신 기술 수준의 few-shot 성능을 달성하며, 기존 이벤트 기반 분류기들을 능가한다.
- 전체 데이터셋에 대해 미세조정한 경우, EventCLIP는 N-ImageNet에서 모든 기존 이벤트 분류기보다 뛰어난 성능을 보였다.
- 0-shot EventCLIP와 DiST를 앙상블하면 N-ImageNet 강건성 서브셋에서 정확도가 5% 이상 향상되었으며, 완전히 훈련된 DiST와의 앙상블보다 우수했다.
- 클래스당 20개 샘플(학습 데이터의 2% 미만)만으로 훈련된 EventCLIP는 대부분의 강건성 서브셋에서 온라인 Ev-TTA 버전을 능가했다.
- 100-shot 미세조정(데이터의 8%)을 통해 EventCLIP는 오프라인 Ev-TTA 버전을 초월하여 강건성에서 새로운 최고 기록을 수립했다.
- 레이블 없음 학습에서 일致성 기반 레이블링을 사용한 EventCLIP는 N-ImageNet (Mini)에서 35.26%의 정확도를 달성하여 Ev-LaFOR의 31.28%를 4% 초과 상회했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.