Skip to main content
QUICK REVIEW

[논문 리뷰] Object Tracking by Jointly Exploiting Frame and Event Domain

Jiqing Zhang, Xin Yang|arXiv (Cornell University)|2021. 09. 19.
Video Surveillance and Tracking Methods참고 문헌 47인용 수 4
한 줄 요약

이 논문은 프레임 기반 카메라의 풍부한 텍스처 정보와 이벤트 기반 카메라의 높은 동적 범위 및 시간 해상도를 동시에 활용하여 강건한 단일 객체 추적을 위한 새로운 프레임-이벤트 융합 프레임워크를 제안한다. 교차 도메인 어텐션 메커니즘과 적응형 가중치를 사용함으로써, 기준 데이터셋에서 프레임 전용 SOTA 방법 대비 성공률 10.4% 향상 및 정밀도 11.9% 향상된 최신 기술 수준의 성능을 달성하였으며, 평가를 위해 새로운 대규모 FE108 데이터셋을 도입하였다.

ABSTRACT

Inspired by the complementarity between conventional frame-based and bio-inspired event-based cameras, we propose a multi-modal based approach to fuse visual cues from the frame- and event-domain to enhance the single object tracking performance, especially in degraded conditions (e.g., scenes with high dynamic range, low light, and fast-motion objects). The proposed approach can effectively and adaptively combine meaningful information from both domains. Our approach's effectiveness is enforced by a novel designed cross-domain attention schemes, which can effectively enhance features based on self- and cross-domain attention schemes; The adaptiveness is guarded by a specially designed weighting scheme, which can adaptively balance the contribution of the two domains. To exploit event-based visual cues in single-object tracking, we construct a large-scale frame-event-based dataset, which we subsequently employ to train a novel frame-event fusion based model. Extensive experiments show that the proposed approach outperforms state-of-the-art frame-based tracking methods by at least 10.4% and 11.9% in terms of representative success rate and precision rate, respectively. Besides, the effectiveness of each key component of our approach is evidenced by our thorough ablation study.

연구 동기 및 목표

  • 고역동 범위, 저조도, 빠른 운동과 같은 열악한 조건에서의 프레임 기반 추적의 한계를 해결한다.
  • 프레임 기반 및 이벤트 기반 카메라의 상호보완적 강점을 활용하여 추적의 강건성을 향상시킨다.
  • 장면 신뢰도에 기반해 양 도메인의 시각적 피처를 적응적으로 융합하는 다중 모odal 융합 프레임워크를 개발한다.
  • 미래의 다중 모달 객체 추적 연구를 가능하게 하기 위해 대규모 고주기 프레임-이벤트 데이터셋(FE108)을 구축한다.
  • 광범위한 추상화 및 벤치마킹을 통해 제안된 어텐션 기반 융합 및 적응형 가중치 기법의 효과성을 입증한다.

제안 방법

  • 정확도와 효율성 사이의 최적 균형을 확보하기 위해 $ n=3 $개의 시간 슬라이스를 사용하는 비동기 이벤트 스트림을 가상 프레임으로 변환하는 시간 이산화된 이벤트 집계 방법을 제안한다.
  • 자기 및 교차 어텐션 메커니즘을 모두 활용하여 프레임 도메인과 이벤트 도메인의 피처를 융합하는 교차 도메인 피처 통합기(CDMS)를 설계한다.
  • 이벤트 스트림의 윤곽선 피처를 강화하여 객체 경계 검출 성능을 향상시키기 위해 가장자리 인식 브랜치(EAB)를 도입한다.
  • 각 장면의 신뢰도에 따라 프레임 및 이벤트 피처의 기여도를 동적으로 조정하는 적응형 가중치 기법을 구현한다.
  • 최근 구축한 FE108 데이터셋을 사용해 엔드 투 엔드 모델을 훈련한다. 이 데이터셋은 108개의 시퀀스, 1.5시간의 데이터를 포함하며, 최대 40Hz(프레임), 240Hz(이벤트)의 애너테이션 주파수를 제공한다.
  • 고정 가중치 기반 베이스라인 대비 성능을 뛰어넘는 학습 가능한 가중치 기법을 통해 이벤트 집계를 최적화한다.

실험 결과

연구 질문

  • RQ1프레임 및 이벤트 도메인의 공동 활용이 고역동 범위 및 빠른 운동과 같은 도전적인 조건에서 추적 성능을 크게 향상시킬 수 있는가?
  • RQ2비동기 이벤트 데이터는 CNN 기반 추적 프레임워크에서 동기 프레임 데이터와 효과적으로 변환 및 융합될 수 있는가?
  • RQ3교차 도메인 어텐션 메커니즘은 양 도메인의 상호보완적 피처를 활용하여 특징 표현을 얼마나 향상시킬 수 있는가?
  • RQ4적응형 가중치 기법은 장면 특화된 신뢰도에 기반해 프레임 및 이벤트 기여도를 동적으로 균형 조절함으로써 강건성을 얼마나 향상시키는가?
  • RQ5이벤트 집계 전략과 시간 슬라이싱의 정밀도는 추적 정확도 및 추론 속도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 OTB-100 벤치마크에서 성공률 88.7%, 정밀도 84.1%를 달성하였으며, 최고의 프레임 전용 SOTA 방법 대비 성공률 10.4% 향상 및 정밀도 11.9% 향상되었다.
  • 추상화 연구 결과, 교차 도메인 다중 해상도 어텐션 모듈(CDMS)을 제거할 경우 성능 저하가 가장 크게 발생함을 확인하여, 이 모듈이 피처 융합에서 핵심적인 역할을 한다는 점을 입증하였다.
  • 적응형 가중치 기법은 강건성을 크게 향상시켰다: 프레임 품질이 열 劣한 장면에서는 이벤트 피처에 더 높은 가중치를 할당한다($ w_e > w_f $), 그 반대의 경우도 마찬가지로 적용된다.
  • 시간 슬라이스 수 $ n=3 $를 사용한 이벤트 집계 방법이 정확도와 속도 사이의 최적 균형을 이룩하였으며, 이로 인해 RPR 92.4%, RSR 63.4%를 달성하고 30.1 FPS의 속도를 기록하였다.
  • 108개의 시퀀스와 최대 240Hz의 이벤트 애너테이션 주파수를 갖는 FE108 데이터셋은 현재까지 가장 크고 시간 해상도가 높은 프레임-이벤트 추적 데이터셋이다.
  • 모델은 텍스처가 없는 프레임 도메인에서 유일하게 유용한 신호를 제공하는 이벤트 데이터를 기반으로 한 8개의 도전적인 시각 예제에서 모두 목표를 성공적으로 추적하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.