Skip to main content
QUICK REVIEW

[논문 리뷰] MOTRv2: Bootstrapping End-to-End Multi-Object Tracking by Pretrained Object Detectors

Yuang Zhang, Tiancai Wang|arXiv (Cornell University)|2022. 11. 17.
Human Pose and Action Recognition인용 수 9
한 줄 요약

MOTRv2는 간단하면서도 효과적인 프레임워크를 제안하여, 미리 훈련된 객체 검출기(YOLOX)를 활용해 검출 성능을 부스트함으로써 엔드 투 엔드 다중 객체 추적을 향상시킨다. 검출기에서 생성한 제안을 MOTR의 앵커 쿼리로 사용함으로써 검출과 연관성 간의 분리를 이룩하며, 정확도를 크게 향상시킨다. 이로 인해 DanceTrack(73.4% HOTA)와 BDD100K(43.6% mMOTA)에서 최고 성능(SOTA)을 달성하면서도 엔드 투 엔드 학습을 유지한다.

ABSTRACT

In this paper, we propose MOTRv2, a simple yet effective pipeline to bootstrap end-to-end multi-object tracking with a pretrained object detector. Existing end-to-end methods, MOTR and TrackFormer are inferior to their tracking-by-detection counterparts mainly due to their poor detection performance. We aim to improve MOTR by elegantly incorporating an extra object detector. We first adopt the anchor formulation of queries and then use an extra object detector to generate proposals as anchors, providing detection prior to MOTR. The simple modification greatly eases the conflict between joint learning detection and association tasks in MOTR. MOTRv2 keeps the query propogation feature and scales well on large-scale benchmarks. MOTRv2 ranks the 1st place (73.4% HOTA on DanceTrack) in the 1st Multiple People Tracking in Group Dance Challenge. Moreover, MOTRv2 reaches state-of-the-art performance on the BDD100K dataset. We hope this simple and effective pipeline can provide some new insights to the end-to-end MOT community. Code is available at \url{https://github.com/megvii-research/MOTRv2}.

연구 동기 및 목표

  • 엔드 투 엔드 MOT 프레임워크인 MOTR에서 낮은 검출 성능로 인해 전체 추적 정확도가 저하되는 문제를 해결한다.
  • 공유 트랜스포머 디코더에서 검출과 연관성 학습 간의 본질적 갈등을 해결한다.
  • 미리 훈련된 검출기(YOLOX)에서 유도한 고품질 객체 검출 사전 지식을 활용하여 엔드 투 엔드 추적에서 검출 신뢰도를 향상시킨다.
  • 전체 재훈련이 필요 없이 외부 감독을 통해 검출 성능을 향상시키면서도 엔드 투 엔드 학습을 유지한다.
  • 검출과 추적을 모듈러하고 확장 가능한 방식으로 통합하여 향후 엔드 투 엔드 MOT 연구를 위한 강력하고 단순한 베이스라인을 구축한다.

제안 방법

  • YOLOX에서 생성한 객체 제안을 기반으로 MOTR의 검출 쿼리에서 학습 가능한 위치 인코딩을 사인-余弦 위치 인코딩으로 대체하여 앵커 기반 쿼리 초기화를 가능하게 한다.
  • YOLOX 제안을 제안 쿼리로 사용하여 검출 쿼리를 초기화함으로써 강력한 국소화 사전 지식을 제공하고 검출 헤드의 최적화를 용이하게 한다.
  • 추적을 위해 MOTR의 쿼리 전파 메커니즘을 유지하여 엔드 투 엔드 미분 가능성과 시간적 일관성을 확보한다.
  • 훈련 중에 트랙 쿼리 정렬을 적용: 히운가리안 매칭을 통해 MOTR 예측과 YOLOX 제안을 매칭하고, 트랙 쿼리 앵커를 YOLOX 박스에 정렬하여 국소화 드리프트를 감소시킨다.
  • 일치하지 않는 MOTR 예측을 제거하여 가짜 양성 예측을 제거하고, 검출 및 연관성 정확도를 향상시킨다.
  • 학습 안정성 향상과 검출 성능 향상을 위해 쿼리 노이즈 제거를 도입하였으며, 노이즈 스케일은 DanceTrack 검증 세트에서 튜닝하였다.

실험 결과

연구 질문

  • RQ1미리 훈련된 객체 검출기를 통합함으로써 엔드 투 엔드 다중 객체 추적에서 검출 성능을 크게 향상시킬 수 있는가?
  • RQ2검출기에서 생성한 제안을 쿼리 앵커로 사용함으로써 공동 학습 프레임워크에서 검출과 연관성 간의 갈등을 완화할 수 있는가?
  • RQ3고품질 검출 사전 지식을 통한 향상에도 불구하고 엔드 투 엔드 학습을 유지하면서 엔드 투 엔드 MOT 모델이 최고 성능(SOTA)을 달성할 수 있는가?
  • RQ4복잡한 추적 환경에서 국소화 오차와 가짜 양성 예측을 줄이기 위해 트랙 쿼리 정렬이 얼마나 효과적인가?
  • RQ5쿼리 노이즈 제거가 MOTRv2 프레임워크에서 검출 및 연관성 지표에 어떤 영향을 미치는가?

주요 결과

  • DanceTrack 데이터셋에서 MOTRv2는 73.4% HOTA를 기록하여 이전 SOTA인 OC-SORT보다 HOTA 14.8%p, AssA 18.8%p 향상되었다.
  • 대규모 BDD100K 데이터셋에서 MOTRv2는 43.6% mMOTA를 달성하여 이전 SOTA인 Unicorn보다 2.4%p 향상되었다.
  • MOT17에서 MOTRv2는 트랙 쿼리 정렬을 완전히 적용한 결과 86.8% MOTA와 79.7% IDF1을 기록하여 기본 MOTR 및 다른 엔드 투 엔드 방법보다 뚜렷이 슈퍼리어하다.
  • 특히 YOLOX 제안에 앵커를 정렬하는 트랙 쿼리 정렬은 MOTA를 8.4%p, IDF1을 3.9%p 향상시켜 기본 MOTR 대비 성능 향상을 이끌었다.
  • 일치하지 않는 MOTR 예측을 제거함으로써 앵커 정렬과 조합했을 때 MOTA가 2.0%p 향상되었으며, 가짜 양성 예측이 감소하였다.
  • 쿼리 노이즈 제거로 DetA가 2.1%p, HOTA가 0.8%p 향상되어 학습 안정성 향상과 검출 품질 향상에 효과적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.