Skip to main content
QUICK REVIEW

[논문 리뷰] MOTR: End-to-End Multiple-Object Tracking with Transformer

Fangao Zeng, Bin Dong|arXiv (Cornell University)|2021. 05. 07.
Video Surveillance and Tracking Methods참고 문헌 54인용 수 16
한 줄 요약

MOTR는 트랙 쿼리라는 학습 가능한 쿼리를 사용하는 트랜스포머 기반 아키텍처를 기반으로 한 엔드 투 엔드 다중 객체 추적 프레임워크를 제안한다. 이 쿼리는 프레임 간에 반복적으로 업데이트되어 객체 궤적을 모델링한다. 트랙릿 인식 레이블 할당, 동적 트랙 관리용 입구 및 퇴출 메커니즘, 집합 평균 손실 및 시간적 집계 네트워크와 같은 시간적 모델링 구성 요소를 도입함으로써, MOTR는 DanceTrack에서 HOTA 지표로 ByteTrack를 6.5% 뛰어넘는 최고 성능을 달성했으며, MOT17에서도 뛰어난 성능 향상을 보였다.

ABSTRACT

Temporal modeling of objects is a key challenge in multiple object tracking (MOT). Existing methods track by associating detections through motion-based and appearance-based similarity heuristics. The post-processing nature of association prevents end-to-end exploitation of temporal variations in video sequence. In this paper, we propose MOTR, which extends DETR and introduces track query to model the tracked instances in the entire video. Track query is transferred and updated frame-by-frame to perform iterative prediction over time. We propose tracklet-aware label assignment to train track queries and newborn object queries. We further propose temporal aggregation network and collective average loss to enhance temporal relation modeling. Experimental results on DanceTrack show that MOTR significantly outperforms state-of-the-art method, ByteTrack by 6.5% on HOTA metric. On MOT17, MOTR outperforms our concurrent works, TrackFormer and TransTrack, on association performance. MOTR can serve as a stronger baseline for future research on temporal modeling and Transformer-based trackers. Code is available at https://github.com/megvii-research/MOTR.

연구 동기 및 목표

  • 기존 MOT 방법에서 후처리 연합 기법의 한계를 해결하기 위해 객체 궤적의 완전한 엔드 투 엔드 학습을 가능하게 한다.
  • 영상 프레임 간 반복적인 쿼리 업데이트를 통해 외관과 운동의 시간적 변동을 함께 모델링한다.
  • IoU 또는 Re-ID와 같은 히우리스틱 매칭이 필요 없도록 트랜스포머 프레임워크 내부에서 직접 트랙 연합을 학습한다.
  • 차폐 및 아이덴티티 전환과 같은 어려운 시퀀스에서의 일반화 성능 향상을 위해 향상된 시간적 모델링을 제공한다.

제안 방법

  • DETR를 확장하여 객체 트랙의 히든 상태로 기능하는 '트랙 쿼리'를 도입하고, 프레임 간에 자기 및 크로스 어텐션을 통해 이를 업데이트한다.
  • 같은 아이덴티티를 가진 참조 박스 시퀀스를 사용해 트랙 쿼리를 감독하기 위해 트랙릿 인식 레이블 할당(TALA)을 활용한다.
  • 새로운 객체는 삽입을 통해, 종료된 트랙은 제거를 통해 동적으로 트랙 쿼리를 관리하기 위한 입구 및 퇴출 메커니즘을 도입한다.
  • 자신의 이전 상태에 접근할 수 있도록 키-쿼리 메커니즘을 사용하는 시간적 집계 네트워크(TAN)를 제안하여 장거리 모델링을 향상시킨다.
  • 전체 영상 클립에서 손실을 집계하여 시간적 일관성을 향상시키기 위해 집합 평균 손실(CAL)을 도입한다.
  • 훈련 중에 객체의 입구 및 퇴출 시나리오를 시뮬레이션하기 위해 $p_{drop}$ 및 $p_{insert}$ 확률을 사용해 트랙 쿼리의 삭제 및 삽입을 수행한다.

실험 결과

연구 질문

  • RQ1후처리 연합 없이도 엔드 투 엔드 트랜스포머 기반 프레임워크가 다중 객체 추적에서 외관과 운동의 변동을 함께 모델링할 수 있는가?
  • RQ2객체 궤적을 완전히 모델링하기 위해 쿼리가 프레임 간에 효과적으로 업데이트되고 할당될 수 있는가?
  • RQ3장거리 시간적 의존성과 차폐 상황에서의 일반화 성능 향상을 위해 가장 효과적인 훈련 전략은 무엇인가?
  • RQ4CAL을 통해 영상 클립 전체를 통합 최적화할 경우, 프레임 단위 훈련 대비 추적의 강건성이 어떻게 향상되는가?
  • RQ5쿼리 수준의 메커니즘(입구/퇴출, 삭제/삽입)이 새로 탄생하거나 종료된 객체의 추적에 얼마나 기여하는가?

주요 결과

  • DanceTrack 데이터셋에서 MOTR는 HOTA 지표로 최고 성능 기록인 ByteTrack를 6.5% 뛰어넘었고, AssA 지표로는 8.1% 향상되었다.
  • MOT17에서 MOTR는 TrackFormer 및 TransTrack와 같은 동시대의 방법들보다 뛰어난 연합 성능을 달성했다.
  • TAN을 기본 모델에 통합함으로써 MOTA는 7.8% 향상되고 IDF1은 13.6% 향상되어 시간적 역학을 모델링하는 데의 효과를 입증했다.
  • 길이 5인 영상 클립을 사용한 집합 평균 손실(CAL) 적용으로 MOTA는 8.3% 향상되고 IDF1은 7.1% 향상되어 차폐 및 어려운 케이스 처리에 있어 뚜렷한 성과를 보였다.
  • 최적의 훈련 초모수는 $p_{drop} = 0.1$ (쿼리 삭제) 및 $p_{insert} = 0.3$ (쿼리 삽입)로, MOTA를 극대화하면서도 높은 IDF1 유지를 달성했다.
  • 훈련 중 샘플링 간격은 강력한 영향을 미친다: 간격이 10을 초과하면 성능 저하가 발생하지만, 간격이 2~10일 경우 IDS를 209에서 155로 감소시켜 추적 성능을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.