Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Object Detection and Multi-Object Tracking with Graph Neural Networks

Yongxin Wang, Kris Kitani|arXiv (Cornell University)|2020. 06. 23.
Video Surveillance and Tracking Methods인용 수 16
한 줄 요약

이 논문은 공간-시간적 객체 관계를 모델링하기 위해 그래프 신경망(GNNs)을 사용하는 공동 다중 객체 추적(MOT) 프레임워크를 제안한다. 이는 객체 검출 및 데이터 연동을 동시에 수행한다. GNN을 활용해 프레임 간의 상호 객체 의존성을 포착함으로써, MOT15/16/17/20 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 검출 및 추적 메트릭 모두에서 이전의 공동 및 별도 방법들을 능가한다.

ABSTRACT

Object detection and data association are critical components in multi-object tracking (MOT) systems. Despite the fact that the two components are dependent on each other, prior works often design detection and data association modules separately which are trained with separate objectives. As a result, one cannot back-propagate the gradients and optimize the entire MOT system, which leads to sub-optimal performance. To address this issue, recent works simultaneously optimize detection and data association modules under a joint MOT framework, which has shown improved performance in both modules. In this work, we propose a new instance of joint MOT approach based on Graph Neural Networks (GNNs). The key idea is that GNNs can model relations between variable-sized objects in both the spatial and temporal domains, which is essential for learning discriminative features for detection and data association. Through extensive experiments on the MOT15/16/17/20 datasets, we demonstrate the effectiveness of our GNN-based joint MOT approach and show state-of-the-art performance for both detection and MOT tasks. Our code is available at: https://github.com/yongxinw/GSDT

연구 동기 및 목표

  • 검출 및 데이터 연동 모듈를 별도로 훈련하고 엔드 투 엔드 최적화를 수행하지 않는 이전 MOT 시스템의 열악한 성능을 해결한다.
  • 검출 과정에서 객체 간 관계를 忽시하는 이전의 공동 MOT 방법의 한계를 극복한다. 이는 관계가 데이터 연동에 사용되더라도 마찬가지로 적용된다.
  • 공간과 시간에서 크기가 변하는 객체 간 상호작용을 모델링하여 검출 및 데이터 연동을 위한 특징의 구분 능력을 향상시킨다.
  • GNN을 사용해 검출 및 데이터 연동을 공동 최적화하면 별도 훈련 또는 관계 무시 공동 훈련보다 더 나은 종합적인 MOT 성능을 달성함을 입증한다.
  • GNN을 통합한 통합적이고 미분 가능한 MOT 프레임워크를 통해 다중 객체 추적의 새로운 SOTA 기준을 설정한다.

제안 방법

  • 노드가 프레임 간 검출된 객체(바운딩 박스)를 나타내고, 간선이 객체 간 공간적·시간적 근접도를 표현하는 그래프를 구축한다.
  • 특히 AGNNConv 레이어를 사용한 그래프 신경망(GNN)을 적용하여 노드 간 특징을 전파하고 집계함으로써, 각 객체의 표현이 공간적·시간적 이웃에 기반해 업데이트되도록 한다.
  • GNN 처리된 특징을 검출 헤드(바운딩 박스 및 클래스 예측용)와 데이터 연동 헤드(Re-ID 및 트랙렛 매칭용)의 입력으로 사용한다.
  • 검출 손실(예: 분류 및 박스 회귀)과 추적 손실(예: triplet 또는 대비 손실을 통한 Re-ID)을 조합한 공동 손실을 사용해 전체 네트워크를 엔드 투 엔드로 훈련한다.
  • 검출 및 연동 모듈를 모두 거쳐 기울기 흐름이 가능하도록, 검출 기반 추적 파ip라인에 GNN을 통합한다.
  • 기본 모델로 오프 더 샷 검출기(예: Faster R-CNN)를 사용하고, 최종 예측 헤드 이전에 객체 간 의존성을 모델링하기 위해 GNN으로 특징을 보강한다.

실험 결과

연구 질문

  • RQ1GNN을 통해 공간-시간적 객체 관계를 모델링하면 공동 MOT 프레임워크에서 검출 및 데이터 연동 성능 향상에 기여하는가?
  • RQ2상호 객체 의존성을 포착하는 GNN을 사용해 엔드 투 엔드로 훈련하면 별도 훈련 또는 관계를 고려하지 않는 공동 훈련보다 더 나은 검출 및 추적 성능을 달성하는가?
  • RQ3GNN 아키텍처의 깊이가 검출 정확도와 추적 일관성 간의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ4관계를 데이터 연동에서만 사용하는 이전 방법보다 GNN 기반 관계 모델링이 더 효과적인가?
  • RQ5공시 또는 함께 움직이는 객체 간의 맥락적 관계를 활용해 GNN이 잡음 신호와 정체성 전환을 줄일 수 있는가?

주요 결과

  • 제안된 GNN 기반 공동 MOT 프레임워크는 MOTChallenge 벤치마크인 MOT15, MOT16, MOT17, MOT20에서 모두 최신 기술 수준(SOTA) 성능을 달성하였다.
  • MOT17에서 이는 87.8%의 정밀도와 90.7%의 재현도를 기록하여 F_ViPeD_B 및 ZIZOM과 같은 이전 방법들을 능가하는 검출 메트릭을 확보하였다.
  • MOT15에서는 MOTA 82.1%와 IDF1 76.4%를 기록하였으며, 정체성 전환 수(IDS: 71)가 GNN이 없는 기준선(139)보다 크게 감소하여 강력한 추적 일관성을 입증하였다.
  • 제거 분석 결과, 단 한 개의 GNN 레이어를 추가하는 것만으로도 GNN이 없는 기준선 대비 MOTA가 2.1%p 향상되었으며, 이는 관계 모델링의 효과를 확인한다.
  • 3층 GNN 모델은 최고의 MOTA(82.1%)를 기록했지만, 2층 모델 대비 약간 낮은 IDF1(76.4%)을 기록하여 검출과 추적 최적화 사이의 트레이드오프가 있음을 시사한다.
  • 이전의 공동 방법([22, 30])과 별도 방법([34])과 비교해 본 논문의 방법은 모든 데이터셋에서 일관되게 뛰어난 성능을 보였으며, SOTA 성능을 달성하기 위해 공동 최적화와 관계 모델링이 필수적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.