[논문 리뷰] Masked Event Modeling: Self-Supervised Pretraining for Event Cameras
이 논문은 이벤트 카메라를 위한 자기지도 학습 사전 훈련 프레임워크인 마스킹 이벤트 모델링(Masked Event Modeling, MEM)을 제안한다. 이는 비디오 훈련 기반의 비디오 인식 모델을 사용하여 마스킹된 이벤트 시퀀스를 재구성한다. 대규모 레이블이 없는 이벤트 데이터에서 사전 훈련을 통해 MEM는 N-ImageNet, N-Cars, N-Caltech101에서 최신 기술 수준의 정확도를 달성하며, 실제 이벤트 데이터에서의 지도 학습 RGB 사전 훈련을 능가하는 성능을 보이며, 의미 분할 작업에서 높은 레이블 효율성과 일반화 능력을 입증한다.
Event cameras asynchronously capture brightness changes with low latency, high temporal resolution, and high dynamic range. However, annotation of event data is a costly and laborious process, which limits the use of deep learning methods for classification and other semantic tasks with the event modality. To reduce the dependency on labeled event data, we introduce Masked Event Modeling (MEM), a self-supervised framework for events. Our method pretrains a neural network on unlabeled events, which can originate from any event camera recording. Subsequently, the pretrained model is finetuned on a downstream task, leading to a consistent improvement of the task accuracy. For example, our method reaches state-of-the-art classification accuracy across three datasets, N-ImageNet, N-Cars, and N-Caltech101, increasing the top-1 accuracy of previous work by significant margins. When tested on real-world event data, MEM is even superior to supervised RGB-based pretraining. The models pretrained with MEM are also label-efficient and generalize well to the dense task of semantic image segmentation.
연구 동기 및 목표
- 딥 러닝 작업을 위한 이벤트 데이터의 고비용 및 고노력 레이블링에 대한 의존도를 줄이기 위해.
- 레이블이 없는 이벤트 시퀀스의 시간적 및 공간적 구조를 활용하는 자기지도 사전 훈련 프레임워크를 개발하기 위해.
- 이미지 분류 및 의미 분할과 같은 이벤트 기반 비전 작업의 성능을 향상시키기 위해.
- 다양한 이벤트 데이터셋과 실제 환경 기록에서 높은 레이블 효율성과 강력한 일반화 능력을 확보하기 위해.
- 이벤트 카메라 벤치마크에서 기존의 지도 학습 및 자기지도 학습 방법, 특히 RGB 기반 사전 훈련을 능가하는 성능을 내기 위해.
제안 방법
- 이 방법은 마스킹된 자동에코 목표를 사용하며, 이벤트 시퀀스의 무작위 시간적 및 공간적 세그먼트가 마스킹되고 모델이 이를 재구성한다.
- 비전 트랜스포머(Vision Transformer, ViT) 백본이 타임스탬프가 부여된 극성 이벤트를 포함하는 이벤트 텐서로 이벤트 데이터를 처리한다.
- 다양하고 대규모의 레이블이 없는 이벤트 기록을 다양한 이벤트 카메라와 환경에서 사전 훈련한다.
- 사전 훈련 중에 다중 헤드 자기주의를 통해 주변 컨텍스트를 참조하여 누락된 이벤트 세그먼트를 예측함으로써 모델이 학습한다.
- 사전 훈련 후, 최소한의 레이블 데이터로 하류 작업에 대해 미세조정을 수행하여 강력한 소수의 샘플 및 제로 샘플 성능을 달성한다.
- 마스킹된 이벤트 시퀀스에 대한 재구성 손실을 사용하여 엔드 투 엔드로 프레임워크를 훈련함으로써 인간 레이블이 없는 표현 학습이 가능하다.
실험 결과
연구 질문
- RQ1레이블이 없는 이벤트 데이터에서 자기지도 사전 훈련이 하류 이벤트 기반 비전 작업의 성능을 향상시킬 수 있는가?
- RQ2실제 이벤트 데이터에서 MEM는 지도 학습 RGB 기반 사전 훈련과 비교해 어떻게 성능을 냈는가?
- RQ3MEM는 다양한 이벤트 데이터셋과 하류 작업으로 얼마나 잘 일반화되는가?
- RQ4MEM 프레임워크는 낮은 데이터 환경에서 얼마나 레이블 효율적인가?
- RQ5감독 없이도 이벤트 시퀀스의 마스킹 재구성은 의미 있는 시공간 표현을 학습할 수 있는가?
주요 결과
- MEM는 N-ImageNet, N-Cars, N-Caltech101에서 최신 기술 수준의 정확도를 달성하며, 이전 방법들을 크게 능가한다.
- 실제 이벤트 데이터에서 MEM는 분류 정확도에서 지도 학습 RGB 기반 사전 훈련을 능가하며, 더 뛰어난 도메인 일반화 능력을 보여준다.
- 모델은 레이블 효율성이 매우 뛰어나, 미세조정 시 최소한의 레이블 데이터로도 높은 성능을 달성한다.
- MEM는 조밀한 예측 작업으로도 잘 일반화되어, 최소한의 적응으로 의미 이미지 분할에서 강력한 성능을 기록한다.
- 다양하고 레이블이 없는 이벤트 기록에서의 사전 훈련은 다양한 데이터셋과 작업 간 효과적으로 전이되는 강력한 표현을 생성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.