Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneous Detection and Tracking with Motion Modelling for Multiple Object Tracking

Shijie Sun, Naveed Akhtar|arXiv (Cornell University)|2020. 08. 20.
Video Surveillance and Tracking Methods참고 문헌 8인용 수 6
한 줄 요약

이 논문은 영상 시퀀스 전반에 걸쳐 운동 파rameter, 객체 클래스, 가시성 등을 모델링함으로써 동시에 객체 검출과 다중 객체 추적을 수행하는 엔드 투 엔드 딥 러닝 프레임워크인 DMM-Net을 제안한다. 120fps 이상에서 UA-DETRAC에서 12.80의 PR-MOTA를 달성하며 외부 검출기 의존도를 제거하였고, 정확한 진짜값을 갖춘 1400만 개 이상의 프레임을 포함하는 오마니-모트(Omni-MOT) 데이터셋을 도입하여 편향 없는 평가를 가능하게 한다.

ABSTRACT

Deep learning-based Multiple Object Tracking (MOT) currently relies on off-the-shelf detectors for tracking-by-detection.This results in deep models that are detector biased and evaluations that are detector influenced. To resolve this issue, we introduce Deep Motion Modeling Network (DMM-Net) that can estimate multiple objects' motion parameters to perform joint detection and association in an end-to-end manner. DMM-Net models object features over multiple frames and simultaneously infers object classes, visibility, and their motion parameters. These outputs are readily used to update the tracklets for efficient MOT. DMM-Net achieves PR-MOTA score of 12.80 @ 120+ fps for the popular UA-DETRAC challenge, which is better performance and orders of magnitude faster. We also contribute a synthetic large-scale public dataset Omni-MOT for vehicle tracking that provides precise ground-truth annotations to eliminate the detector influence in MOT evaluation. This 14M+ frames dataset is extendable with our public script (Code at Dataset , Dataset Recorder , Omni-MOT Source ). We demonstrate the suitability of Omni-MOT for deep learning with DMMNet and also make the source code of our network public.

연구 동기 및 목표

  • 외부 검출기를 사용하지 않고도 딥 러닝 기반 다중 객체 추적에서 검출기 편향을 제거하기 위해 검출과 추적을 하나의 엔드 투 엔드 네트워크로 통합하는 것.
  • 검출 기반 추적 파이프라인에서 외부 검출기로 인한 비효율성과 성능 저하 문제를 해결하는 것.
  • 정확한 진짜값을 갖춘 대규모, 현실적인, 편향 없는 차량 추적용 벤치마크 데이터셋을 개발하는 것.
  • 영상 프레임 간의 객체 운동, 클래스, 가시성을 동시에 추론하여 효율적인 트랙릿 생성을 가능하게 하는 것.
  • 재현 가능하고 투명한 MOT 평가를 지원하기 위해 공개 가능하고 확장 가능한 데이터셋(Omni-MOT)과 코드베이스를 제공하는 것.

제안 방법

  • DMM-Net은 3D ResNet 유사 특징 추출기를 사용하여 16개의 연속 영상 프레임을 처리하여 시공간 표현을 학습한다.
  • 운동 하위넷, 분류기 하위넷, 가시성 하위넷이라는 세 개의 하위넷을 활용하며, 각각 3D 컨볼루션을 사용하여 운동 파ram터, 객체 클래스, 가시성 상태를 예측한다.
  • 네트워크는 2D 앵커 박스를 시간 차원으로 확장한 앵커 튜브를 사용하여 프레임 간 잠재적 객체 트랙을 표현한다.
  • 운동 파aram터는 시공간 공간 내 사전 정의된 앵커 튜브에 대한 오프셋과 스케일로 예측된다.
  • 모든 하위넷에서 운동, 분류, 가시성 예측을 동시에 최적화하기 위한 전용 손실 함수가 설계되었다.
  • 운동 및 외관 일관성 기반으로 프레임 간에 예측된 앵커 튜브를 필터링하고 병합하여 트랙릿을 생성한다.

실험 결과

연구 질문

  • RQ1외부 검출기를 사용하지 않고도 엔드 투 엔드 딥 러닝이 다중 객체 추적에서 객체 검출과 데이터 연동을 동시에 최적화할 수 있는가?
  • RQ2명시적인 운동 파aram터 모델링이 복잡하고 다이나믹한 환경에서 추적 정확도와 효율성을 어떻게 향상시키는가?
  • RQ3정확한 진짜값을 갖는 합성 대규모 데이터셋이 MOT 평가의 편향을 얼마나 줄이고 모델 일반화를 향상시킬 수 있는가?
  • RQ4운동 모델링과 가시성 추정의 통합이 가림 및 외관 변화 상황에서 추적의 강건성을 어떻게 향상시키는가?
  • RQ5제안된 오마니-모트(Omni-MOT) 데이터셋은 엔드 투 엔드 MOT 모델의 훈련 및 평가를 얼마나 효과적으로 지원하는가?

주요 결과

  • DMM-Net은 UA-DETRAC 벤치마크에서 12.80의 PR-MOTA 점수를 기록하여 기존 방법들을 능가하며, 120fps 이상에서 작동한다.
  • 모델은 희귀한 차량 유형과 부분적으로 가려진 객체를 프레임 간에 정확히 추적하는 강력한 일반화 능력을 보였다.
  • UA-DETRAC 훈련 세트에 오마니-모트(Omni-MOT)의 일부를 추가함으로써 성능 향상이 발생하였으며, PR-MOTA는 11.80%에서 12.20%로 상승하였다.
  • 제안된 오마니-모트(Omni-MOT) 데이터셋은 다양한 날씨, 혼잡도, 카메라 조건에서 1400만 개 이상의 프레임, 1억 1000만 개 이상의 바운딩 박스, 25만 개의 트랙을 포함한다.
  • 운동 모델링의 통합으로 네트워크는 외부 검출기가 필요 없이 암묵적으로 객체를 검출하고 추적할 수 있게 되었다.
  • 소스 코드와 데이터셋은 공개되어 있어 재현 가능성을 보장하고 편향 없는 MOT 평가를 위한 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.