Skip to main content
QUICK REVIEW

[논문 리뷰] GET: Group Event Transformer for Event-Based Vision

Yansong Peng, Yueyi Zhang|arXiv (Cornell University)|2023. 10. 04.
Advanced Memory and Neural Computing인용 수 5
한 줄 요약

이 논문은 이벤트 기반 시각을 위한 새로운 비전 트랜스포머 백본인 Group Event Transformer (GET)을 제안한다. GET은 새로운 그룹 토큰 표현과 두 가지 핵심 모듈인 Event Dual Self-Attention (EDSA) 및 Group Token Aggregation (GTA)를 통해 공간, 시간, 극성 정보를 분리한다. GET은 네 가지 이벤트 기반 분류 및 두 가지 객체 검출 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성했으며, CIFAR10-DVS에서 최고 정확도 84.8%와 1Mpx에서 48.4% mAP를 기록했다.

ABSTRACT

Event cameras are a type of novel neuromorphic sen-sor that has been gaining increasing attention. Existing event-based backbones mainly rely on image-based designs to extract spatial information within the image transformed from events, overlooking important event properties like time and polarity. To address this issue, we propose a novel Group-based vision Transformer backbone for Event-based vision, called Group Event Transformer (GET), which de-couples temporal-polarity information from spatial infor-mation throughout the feature extraction process. Specifi-cally, we first propose a new event representation for GET, named Group Token, which groups asynchronous events based on their timestamps and polarities. Then, GET ap-plies the Event Dual Self-Attention block, and Group Token Aggregation module to facilitate effective feature commu-nication and integration in both the spatial and temporal-polarity domains. After that, GET can be integrated with different downstream tasks by connecting it with vari-ous heads. We evaluate our method on four event-based classification datasets (Cifar10-DVS, N-MNIST, N-CARS, and DVS128Gesture) and two event-based object detection datasets (1Mpx and Gen1), and the results demonstrate that GET outperforms other state-of-the-art methods. The code is available at https://github.com/Peterande/GET-Group-Event-Transformer.

연구 동기 및 목표

  • 이벤트 기반 백본이 이미지 기반 설계에 의존하고 비동기 이벤트의 시간 및 극성 정보를 충분히 활용하지 못하는 한계를 해결한다.
  • 시간과 극성에 따라 이벤트를 명시적으로 그룹화하는 새로운 이벤트 표현을 개발하여 시공간 역학을 유지한다.
  • 공간, 시간, 극성 차원 간의 효과적인 다중 도메인 특징 통신을 가능하게 하는 트랜스포머 기반 아키텍처를 설계한다.
  • 분류 및 객체 검출을 포함한 다양한 이벤트 기반 시각 작업에서 뛰어난 성능을 달성하면서도 파라미터 효율성과 추론 속도를 유지를 한다.

제안 방법

  • 비동기 이벤트를 시간대와 극성에 따라 군집화하여 이산적이고 학습 가능한 토큰으로 만드는 새로운 이벤트 표현인 Group Token을 제안한다.
  • 이중 잔차 연결을 통해 특징 학습을 향상시키는 이중 병렬 주의 메커니즘을 갖춘 Event Dual Self-Attention (EDSA) 모듈을 도입한다. 이 모듈은 국소적 공간 주의와 그룹 주의를 동시에 수행한다.
  • 겹치는 그룹 컨벌루션을 사용하여 공간 및 시간-극성 도메인에서 토큰을 융합하는 Group Token Aggregation (GTA) 모듈을 설계하여 전역적 맥락 통합을 가능하게 한다.
  • 계층적 특징 학습을 갖춘 3단계 트랜스포머 백본으로 GET을 구성하며, 그룹 토큰이 점차적으로 더 큰 그룹으로 융합되어 수신장이 확장되도록 한다.
  • 이미지 분류 및 객체 검출과 같은 최종 작업에 적합한 태스크 전용 헤드와 함께 GET을 통합하여 엔드 투 엔드 학습을 수행한다.
  • 이벤트 그룹화의 세분성을 제어하는 군집 수 하이퍼파rameter G를 최적화하며, 이는 데이터셋에 따라 시간 지속 기간에 따라 조정된다.

실험 결과

연구 질문

  • RQ1이미지 기반 표현에 의존하지 않고도 비전 트랜스포머 백본이 이벤트 스트림에서 시간 및 극성 정보를 효과적으로 활용할 수 있는가?
  • RQ2특징 추출 과정에서 공간, 시간, 극성 특징을 분리함으로써 이벤트 기반 시각 작업 성능에 어떤 영향을 미치는가?
  • RQ3동시에 공간 관계와 시간-극성 간의 그룹 간 동적 관계를 모델링할 수 있는 최적의 주의 메커니즘 설계는 무엇인가?
  • RQ4그룹 수 G의 선택이 시간 지속 기간이 다양한 데이터셋에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5저전력, 고속 조건에서 기존 SOTA 방법에 비해 제안된 아키텍처가 분류 및 객체 검출 작업에서 얼마나 뛰어난 성능을 보이는가?

주요 결과

  • CIFAR10-DVS 데이터셋에서 GET은 84.8%의 상위 1위 정확도를 기록했으며, 이는 이전 SOTA 방법보다 2.9%p 높은 성능이다 (예: 기준 EDSA로 81.9%).
  • N-MNIST 데이터셋에서는 GET이 99.7%의 정확도를 달성하여 짧은 지속 기간, 고속 이벤트 스트림에서 뛰어난 성능을 보였다.
  • DVS128Gesture 데이터셋에서는 그룹 수 G를 24로 설정했을 때 97.9%의 상위 1위 정확도를 기록했으며, 이는 장시간 시퀀스 동작에 최적의 그룹화임을 시사한다.
  • 객체 검출 작업에서는 1Mpx 데이터셋에서 48.4% mAP, Gen1에서 47.9% mAP를 기록했으며, Swin-T v2 및 기타 SOTA 모델을 능가했다.
  • 제거 실험 결과 EDSA 및 GTA 모듈이 핵심임을 확인했으며, Swin-T v2나 Nested-T의 대체 모듈로 교체할 경우 정확도가 최대 7.4%p 감소했다.
  • 시각화 결과는 EDSA를 사용하는 GET만이 운동 방향(예: 반시계 방향 흔들기)을 정확히 포착하는 반면, 표준 주의 메커니즘을 사용하는 모델들은 빈약한 시간-극성 모델링으로 인해 운동을 잘못 분류하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.