Skip to main content
QUICK REVIEW

[논문 리뷰] VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows

Xiao Wang, Jianing Li|arXiv (Cornell University)|2021. 08. 11.
Advanced Memory and Neural Computing참고 문헌 73인용 수 20
한 줄 요약

이 논문은 가시영상 영상 추적을 위한 대규모 벤치마크인 VisEvent를 제안하고, RGB 및 이벤트 카메라에서 유래한 특징을 융합하기 위해 교차 모odal 트랜스포머(CMT)를 도입한다. 두 센서의 상호보완적 특성—가시영상 카메라의 텍스처 정보와 이벤트 카메라의 운동 안정성—을 활용하여 VisEvent에서 최신 기술 수준의 성능을 달성하였으며, 성공률는 0.430, 정밀도는 0.632를 기록하였다.

ABSTRACT

Different from visible cameras which record intensity images frame by frame, the biologically inspired event camera produces a stream of asynchronous and sparse events with much lower latency. In practice, visible cameras can better perceive texture details and slow motion, while event cameras can be free from motion blurs and have a larger dynamic range which enables them to work well under fast motion and low illumination. Therefore, the two sensors can cooperate with each other to achieve more reliable object tracking. In this work, we propose a large-scale Visible-Event benchmark (termed VisEvent) due to the lack of a realistic and scaled dataset for this task. Our dataset consists of 820 video pairs captured under low illumination, high speed, and background clutter scenarios, and it is divided into a training and a testing subset, each of which contains 500 and 320 videos, respectively. Based on VisEvent, we transform the event flows into event images and construct more than 30 baseline methods by extending current single-modality trackers into dual-modality versions. More importantly, we further build a simple but effective tracking algorithm by proposing a cross-modality transformer, to achieve more effective feature fusion between visible and event data. Extensive experiments on the proposed VisEvent dataset, FE108, COESOT, and two simulated datasets (i.e., OTB-DVS and VOT-DVS), validated the effectiveness of our model. The dataset and source code have been released on: \url{https://github.com/wangxiao5791509/VisEvent_SOT_Benchmark}.

연구 동기 및 목표

  • 저조도, 고속, 배경 혼잡도 등의 도전적인 조건에서 실용적이고 대규모인 가시영상-이벤트 영상 추적을 위한 데이터셋 부족 문제를 해결한다.
  • 가시영상과 이벤트 데이터를 효과적으로 융합하여 추적 강건성을 향상시키는 双모달 추적 프레임워크를 개발한다.
  • RGB와 이벤트 모달 간의 상호작용적 특징 학습 및 융합을 위한 단순하면서도 효과적인 교차 모달 트랜스포머 모듈을 설계한다.
  • 뉴모르픽 시각 추적 분야의 체계적 평가 및 발전을 가능하게 하기 위해 종합적인 벤치마크와 기준 방법을 수립한다.
  • 다양한 데이터셋과 시나리오에서 기존의 단일 모달 및 이중 모달 추적기들과 비교하여 제안된 방법의 우수성을 입증한다.

제안 방법

  • 저조도, 고속, 혼잡도 조건에서 DVS와 RGB 카메라를 사용하여 촬영한 총 820개의 영상 쌍(학습용 500개, 테스트용 320개)을 포함하는 대규모 벤치마크인 VisEvent를 제안한다.
  • 고정된 시간 윈도우 동안 이벤트 스트림을 쌓아 이벤트 이미지로 변환하여 딥러닝 모델과의 통합을 가능하게 한다.
  • 연결, 요소별 덧셈, 1×1 컨볼루션 융합 전략을 사용하여 30개 이상의 단일 모달 추적기를 이중 모달 버전으로 확장한다.
  • 가시영상과 이벤트 특징 간의 이중 방향 특징 상호작용과 주목적 기반 융합을 가능하게 하는 교차 모달 트랜스포머(CMT) 모듈을 설계한다.
  • CMT에서 교차 주목적 메커니즘을 활용하여 모달 간 관련 특징을 동적으로 가중함으로써 추적을 위한 표현 학습을 향상시킨다.
  • VisEvent, FE108, COESOT, 그리고 시뮬레이션된 데이터셋(OTB-DVS, VOT-DVS)에서 모델을 평가하여 강건성과 일반화 능력을 검증한다.

실험 결과

연구 질문

  • RQ1저조도, 고속, 혼잡도 조건에서 실용적이고 대규모인 가시영상-이벤트 영상 추적을 위한 벤치마크를 체계적인 평가를 지원하는 방식으로 효과적으로 구축할 수 있는가?
  • RQ2가시영상과 이벤트 모달 특징의 융합은 저조도, 고속, 혼잡도 조건에서 추적 성능에 어떤 영향을 미치는가?
  • RQ3연결, 덧셈, 또는 주목적 기반 메커니즘 중 어떤 특징 융합 전략이 이중 모달 추적에서 최고의 성능을 내는가?
  • RQ4교차 모달 트랜스포머 모듈은 가시영상과 이벤트 데이터 간의 상호보완적 정보를 효과적으로 학습하고 활용하여 추적 정확도를 향상시킬 수 있는가?
  • RQ5제안된 방법은 실세계 및 시뮬레이션된 데이터셋(VisEvent 및 기존 벤치마크 포함)에서 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 VisEvent 벤치마크는 저조도, 고속, 혼잡도 조건에서 실용적으로 촬영한 총 820개의 영상 쌍을 포함하며, 이중 모달 추적을 위한 종합적인 시험 환경을 제공한다.
  • 다양한 융합 전략 중에서 연결이 가장 높은 성능을 기록하여 VisEvent 테스트 세트에서 성공률 0.426, 정밀도 0.627를 달성하였다.
  • 교차 모달 트랜스포머(CMT)는 VisEvent에서 성공률 0.430, 정밀도 0.632를 기록하여 모든 기준 방법 및 기존 최신 기술 수준의 추적기들을 능가하였다.
  • CMT 기반 추적기는 운동 왜곡, 저조도, 고속 운동 상황에서도 뛰어난 강건성을 보였으며, 정성적 시각화를 통해 검증되었다.
  • 빠르게 움직이는 작은 물체(예: 야구공)나 겹치는 이벤트 스트림(예: 움직이는 별)이 있는 시나리오에서는 실패 케이스가 관찰되어 현재의 이벤트 이미지 표현 방식의 한계가 드러났다.
  • 본 연구는 이벤트 카메라가 효과적인 융합을 통해 가시영상 데이터와 조합될 경우, 특히 어려운 시각 조건에서 추적 성능을 크게 향상시킬 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.