Skip to main content
QUICK REVIEW

[논문 리뷰] Tracking Objects as Points

Xingyi Zhou, Vladlen Koltun|arXiv (Cornell University)|2020. 04. 02.
Video Surveillance and Tracking Methods참고 문헌 57인용 수 18
한 줄 요약

CenterTrack는 객체를 프레임 간 중심 위치로 추적함으로써 간단하고 실시간으로 다중 객체 추적을 수행하는 방법을 제안한다. 이는 두 개의 연속 프레임과 이전 검출 결과의 히트맵을 조건으로 하는 단계 검출기와 함께 작동하며, 객체 중심과 이전 위치로의 오프셋을 예측함으로써 엔드 투 엔드로 미분 가능한 추적을 가능하게 하며, 탐지 및 할당을 동시에 처리함으로써 MOT17에서 67.8%의 최고 수준의 MOTA, KITTI에서 89.4%, 그리고 nuScenes 3D에서 AMOTA@0.2 기준 28.3%의 성능을 달성한다.

ABSTRACT

Tracking has traditionally been the art of following interest points through space and time. This changed with the rise of powerful deep networks. Nowadays, tracking is dominated by pipelines that perform object detection followed by temporal association, also known as tracking-by-detection. In this paper, we present a simultaneous detection and tracking algorithm that is simpler, faster, and more accurate than the state of the art. Our tracker, CenterTrack, applies a detection model to a pair of images and detections from the prior frame. Given this minimal input, CenterTrack localizes objects and predicts their associations with the previous frame. That's it. CenterTrack is simple, online (no peeking into the future), and real-time. It achieves 67.3% MOTA on the MOT17 challenge at 22 FPS and 89.4% MOTA on the KITTI tracking benchmark at 15 FPS, setting a new state of the art on both datasets. CenterTrack is easily extended to monocular 3D tracking by regressing additional 3D attributes. Using monocular video input, it achieves 28.3% AMOTA@0.2 on the newly released nuScenes 3D tracking benchmark, substantially outperforming the monocular baseline on this benchmark while running at 28 FPS.

연구 동기 및 목표

  • 객체를 중심점으로 표현함으로써 연관성과 검출의 복잡성을 줄여 다중 객체 추적을 단순화한다.
  • 실시간으로 객체를 동시에 검출하고 연관짓는 엔드 투 엔드, 미분 가능한 추적을 가능하게 한다.
  • 최소한의 계산 부담으로 MOT17, KITTI, nuScenes 3D 벤치마크에서 최고 성능을 달성한다.
  • 실제 영상이 없이도 강력한 데이터 증강 기법을 활용해 정적 이미지에서 효과적으로 추적 모델을 훈련시킬 수 있음을 보여준다.
  • 수동으로 설계된 운동 모델(예: 칼만 필터, 옵티컬 플로우)보다 학습된 오프셋 예측기가 복잡한 추적 환경에서 더 우수한 성능을 낸다.

제안 방법

  • CenterTrack는 현재 프레임과 이전 프레임을 입력으로 사용하며, 이전 트랙릿의 히트맵을 함께 활용해 CenterNet을 통해 객체 중심을 검출한다.
  • 현재 객체 중심에서 이전 프레임의 해당 중심으로 향하는 2차원 오프셋 벡터를 예측함으로써 직접적인 연관성을 확보한다.
  • 예측된 오프셋과 히트맵 상의 이전 검출 위치를 기반으로 탐지 결과 간 그레디티 매칭을 통해 객체를 연관짓는다.
  • 실제 영상이 없이도 운동을 시뮬레이션하는 강력한 데이터 증강 기법을 사용해 정적 이미지에서 훈련할 수 있도록 한다.
  • 모델은 순수하게 국소적인 추적 방식을 취하며, 미래 프레임의 정보 없이도 실시간으로 작동한다.
  • 3D 추적을 위해 단일 영상에서 추가적인 3D 속성 회귀를 수행하며, 이는 nuScenes 벤치마크로 확장된다.

실험 결과

연구 질문

  • RQ1객체를 중심점 하나로 모델링하고 프레임 간 오프셋 예측을 학습함으로써 추적을 단순화할 수 있는가?
  • RQ2엔드 투 엔드로 훈련된 검출 및 추적 통합 프레임워크가 복잡한 이중 단계 추적-기반 검출 파이프라인을 능가할 수 있는가?
  • RQ3강력한 데이터 증강 기법을 통해 실재 영상이 없이도 정적 이미지에서 효과적으로 훈련이 가능한가?
  • RQ4실제 추적 벤치마크에서 학습된 오프셋 예측기가 수동으로 설계된 운동 모델(예: 칼만 필터, 옵티컬 플로우)보다 우수한 성능을 낼 수 있는가?
  • RQ5간단하고 국소적인 추적 접근 방식이 MOT17, KITTI, nuScenes 3D 등 다양한 벤치마크에서 최고 성능을 달성할 수 있는가?

주요 결과

  • CenterTrack는 MOT17에서 22 FPS로 67.8%의 MOTA를 달성하며 이 벤치마크의 최고 성능을 수립한다.
  • KITTI 추적 벤치마크에서는 15 FPS로 89.4%의 MOTA를 기록하며 이전 방법들을 능가한다.
  • nuScenes 3D 추적 벤치마크에서 CenterTrack는 AMOTA@0.2 기준 28.3%를 기록하며 단일 영상 기반 기준선보다 약 3배 우수하다.
  • nuScenes에서는 28 FPS로 실행되어 3D 다중 객체 추적의 실시간 성능을 입증한다.
  • 가짜 운동을 포함한 정적 이미지에서의 훈련은 영상 훈련 대비 정확도가 약간 떨어지지만 매우 우수한 성능을 보인다.
  • 탐지 점수 기반 그레디티 매칭이 허긴안 매칭보다 우수하며, 트랙 재생성 기법은 IDF1 성능을 향상시키고 ID 스위치 수를 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.