[논문 리뷰] A Neuromorphic Dataset for Object Segmentation in Indoor Cluttered Environment
이 논문은 스테레오 이벤트 기반 카메라를 사용하여 혼잡한 실내 환경에서의 물체 세분화를 위한 새로운 3D 공간-시간 기준 데이터셋인 이벤트 기반 세분화 데이터셋(ESD)을 소개한다. 이 데이터셋은 145개의 시퀀스, 14,166장의 RGB 프레임, 21.88M/20.80M개의 이벤트를 포함하며, 수작업으로 인스턴스 마스크가 할당되어 있어 융합된 RGB-이벤트 데이터를 통한 고정밀 세분화가 가능하며, 교차 모odal 네트워크를 사용해 알려진 물체에서는 85.81% mIoU, 미지의 물체에서는 18.90% mIoU를 달성한다.
Taking advantage of an event-based camera, the issues of motion blur, low dynamic range and low time sampling of standard cameras can all be addressed. However, there is a lack of event-based datasets dedicated to the benchmarking of segmentation algorithms, especially those that provide depth information which is critical for segmentation in occluded scenes. This paper proposes a new Event-based Segmentation Dataset (ESD), a high-quality 3D spatial and temporal dataset for object segmentation in an indoor cluttered environment. Our proposed dataset ESD comprises 145 sequences with 14,166 RGB frames that are manually annotated with instance masks. Overall 21.88 million and 20.80 million events from two event-based cameras in a stereo-graphic configuration are collected, respectively. To the best of our knowledge, this densely annotated and 3D spatial-temporal event-based segmentation benchmark of tabletop objects is the first of its kind. By releasing ESD, we expect to provide the community with a challenging segmentation benchmark with high quality.
연구 동기 및 목표
- 비정형 실내 환경에서의 물체 세분화를 위한 고품질의 3D 공간-시간 이벤트 기반 데이터셋이 부족한 문제를 해결하기 위해.
- 차폐, 운동 블러, 저조도, 다양한 물체 구성 등의 어려운 조건에서 세분화 알고리즘을 평가하기 위한 기준을 제공하기 위해.
- 이벤트 카메라와 RGB 프레임의 보완적 데이터를 활용한 딥러닝 기반 세분화 모델의 개발 및 비교를 가능하게 하기 위해.
- 실제 혼잡한 환경에서의 그립 및 조작을 위한 로봇 시각 시스템의 발전을 지원하기 위해.
제안 방법
- 저자들은 이벤트 기반 카메라 두 대를 스테레오 구성으로 사용하여 RGB 카메라와 동기화시켜 고시간해상도 이벤트 스트림과 해당 프레임을 촬영하였다.
- 총 145개의 시퀀스가 기록되었으며, 선형, 회전, 선형-회전 운동을 포함한 다양한 카메라 운동, 조명 조건, 그리고 차폐가 포함된 물체 배열을 포함한다.
- 모든 14,166장의 RGB 프레임에 대해 수작업으로 인스턴스 세분화 마스크가 생성되었으며, 두 카메라에서 각각 21.88M개와 20.80M개의 이벤트에 대해 고밀도의 픽셀 수준의 할당이 이루어졌다.
- RGBD 설정을 통해 깊이 정보가 포함되어 있어, 특히 장애물이 있는 장면에서의 3D 공간 이해에 필수적인 정보를 제공한다.
- 융합된 RGB와 이벤트 데이터를 기반으로 두 가지 교차 모달 세분화 모델(SA-GATE 및 CMX)을 훈련하고 평가하여 다양한 조건에서의 성능을 평가하였다.
- 이벤트 데이터는 고유의 MATLAB 도구를 사용해 자동으로 레이블이 지정되어 있어, 일관성과 확장성 있는 할당이 보장되었다.

실험 결과
연구 질문
- RQ1RGB-이벤트 융합이 RGB-only 접근 방식에 비해 혼잡한 실내 환경에서의 인스턴스 세분화 정확도를 얼마나 향상시키는가?
- RQ2이벤트 기반 데이터로 훈련된 모델이 미지의 물체에 대해 세분화 성능을 보일 때, 알려진 물체 세분화와 비교해 어떤 성능을 보이는가?
- RQ3다양한 카메라 운동 유형(선형, 회전, 병합)이 이벤트 기반 시각에서 세분화 정확도에 어떤 영향을 미치는가?
- RQ4기존 RGB 카메라에 비해 이벤트 기반 데이터가 운동 블러와 저조도로 인한 품질 저하를 얼마나 줄이는가?
- RQ5물체 수와 차폐 수준이 이벤트 기반 및 RGB-only 환경에서의 세분화 성능에 어떤 영향을 미치는가?
주요 결과
- CMX 모델은 융합된 RGB와 이벤트 데이터를 사용할 경우 알려진 물체에서 85.81% mIoU를 달성하여 RGB-only 기반 모델보다 뚜렷이 뛰어난 성능을 보였다.
- 미지의 물체에 대해서는 mIoU가 18.90%로 떨어지며, 이벤트 기반 데이터를 통한 제로샷 세분화에서 큰 도전 과제가 있음을 시사한다.
- CMX를 사용할 경우, 회전 운동 동안 세분화 정확도가 선형 운동 대비 각각 3.77%와 4.42% 향상되었으며, 이는 더 풍부한 윤곽 정보 덕분이었다.
- 저조도 조건에서는 RGB-only 방법의 mIoU가 50% 이하로 떨어졌지만, 이벤트 기반 융합은 mIoU를 약 85% 유지하여 조명 변화에 대한 강건성을 입증했다.
- 카메라와 테이블 간 거리가 62–82cm 범위에서 변할 때, CMX 모델은 DeepLabV3에 비해 0.67%의 성능 우위를 유지했으며, 이는 전체 정확도에 미치는 영향은 미미했지만 지속적인 우위를 보였다.
- 다중 물체 시나리오에서는 U자형의 mIoU 추세가 관찰되었으며, 6개의 물체에서 전체가 겹쳐서 포화 상태가 되었을 때 성능이 가장 낮아졌으며, 이는 고밀도의 장애물 상황에서의 어려움을 반영한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.