Skip to main content
QUICK REVIEW

[논문 리뷰] PatchTrack: Multiple Object Tracking Using Frame Patches

Xiaotong Chen, Seyed Mehdi Iranmanesh|arXiv (Cornell University)|2022. 01. 01.
Video Surveillance and Tracking Methods인용 수 12
한 줄 요약

PatchTrack는 현재 프레임의 패치를 활용하여 운동 및 외관 모델링을 향상시킴으로써 다중 객체 추적 성능을 햖थ한 Transformer 기반의 동시 검출 및 추적 시스템이다. Kalman 필터로 예측한 트랙 위치를 이용해 프레임 패치를 추출하고, 이를 트랙 쿼리와 함께 사용하여 패치-트랙 쿼리를 생성함으로써 MOT16(모델 성능 평가 지표 MOTA 73.71%) 및 MOT17(모델 성능 평가 지표 MOTA 73.59%)에서 최고 성능을 달성한다.

ABSTRACT

Object motion and object appearance are commonly used information in multiple object tracking (MOT) applications, either for associating detections across frames in tracking-by-detection methods or direct track predictions for joint-detection-and-tracking methods. However, not only are these two types of information often considered separately, but also they do not help optimize the usage of visual information from the current frame of interest directly. In this paper, we present PatchTrack, a Transformer-based joint-detection-and-tracking system that predicts tracks using patches of the current frame of interest. We use the Kalman filter to predict the locations of existing tracks in the current frame from the previous frame. Patches cropped from the predicted bounding boxes are sent to the Transformer decoder to infer new tracks. By utilizing both object motion and object appearance information encoded in patches, the proposed method pays more attention to where new tracks are more likely to occur. We show the effectiveness of PatchTrack on recent MOT benchmarks, including MOT16 (MOTA 73.71%, IDF1 65.77%) and MOT17 (MOTA 73.59%, IDF1 65.23%). The results are published on https://motchallenge.net/method/MOT=4725&chl=10.

연구 동기 및 목표

  • 이전 프레임의 외관 특징에 과도하게 의존하는 기존 Transformer 기반 MOT 방법의 한계를 해결한다.
  • 현재 프레임의 패치에서 실시간 시각 정보를 통합하여 추적의 강건성을 향상시킨다.
  • 운동 사전 지식과 현재 프레임의 외관 신호를 조합하여 ID 전환과 오분류를 줄인다.
  • 운동과 현재 프레임 외관을 융합한 더 나은 국소화 성능을 위한 새로운 쿼리 메커니즘인 패치-트랙 쿼리 제안.
  • 현재 프레임의 패치를 사용하는 것이 단순 트랙 쿼리 또는 검출 전용 기반 모델에 비해 추적 성능 향상에 기여함을 입증한다.

제안 방법

  • 이전 프레임의 상태를 기반으로 기존 트랙의 현재 프레임 내 위치를 Kalman 필터를 사용해 예측한다.
  • Kalman 필터로 예측한 바운딩 박스를 기반으로 현재 프레임에서 패치를 추출한다.
  • 전체 프레임과 추출된 패치를 각각 CNN 백본을 통해 처리하여 프레임 특징과 패치 쿼리를 추출한다.
  • 이전 프레임의 출력 임bedding에서 유래한 각 트랙 쿼리와 현재 프레임 패치에서 유도된 해당 패치 쿼리를 조합하여 패치-트랙 쿼리를 구성한다.
  • 패치-트랙 쿼리와 객체 쿼리를 Transformer 디코더에 입력하여 동시에 트랙 위치 예측과 새로운 객체 검출을 수행한다.
  • 후처리 단계에서 투명할 알고리즘과 Kalman 필터를 사용하여 트랙 연관성을 정밀 조정하고 가림을 처리한다.

실험 결과

연구 질문

  • RQ1현재 프레임의 패치에서 유도한 시각적 특징을 통합함으로써 동시 검출 및 추적 모델의 추적 성능 향상이 가능한가?
  • RQ2단순히 트랙 쿼리에 의존하는 것과 비교해 운동 사전 지식과 현재 프레임 외관 신호를 조합할 경우 ID 전환과 오분류가 감소하는가?
  • RQ3운동과 현재 프레임 외관을 융합한 패치-트랙 쿼리가 표준 트랙 쿼리 또는 검출 전용 기반 모델과 비교해 어떻게 성능을 냈는가?
  • RQ4패치의 원천(현재 프레임 대비 이전 프레임)이 모델 성능과 강건성에 미치는 영향은 무엇인가?
  • RQ5패치 기반 쿼리 메커니즘이 MOTA 및 IDF1 지표에서 기존 Transformer 기반 MOT 방법을 능가하면서도 오분류를 줄일 수 있는가?

주요 결과

  • MOT16 테스트 세트에서 PatchTrack는 MOTA 73.71% 및 IDF1 65.77%를 기록하여 주요 벤치마크에서 뛰어난 성능을 입증한다.
  • MOT17에서 PatchTrack는 MOTA 73.59% 및 IDF1 65.23%를 달성하여 오분류가 현저히 적은 상위 성능 모델 중 하나로 평가된다.
  • 절단 실험 결과 패치-트랙 쿼리 제거 시 성능 저하가 발생하며, 검출 기반 추적 변형은 ID 전환 수가 200건(비교 대상 192건)으로 증가하여 통합 모델링의 유용성을 확인한다.
  • 현재 프레임의 패치를 사용하면서도 이전 프레임의 바운딩 박스를 기반으로 패치를 추출할 경우 성능 저하(MOTA 62.8%)가 발생함을 확인하여, 정렬 불일치가 특징 품질에 악영향을 준다는 점을 입증한다.
  • MOTA 수준은 유사한 수준을 유지하면서도 TransTrack 대비 오분류 수가 50% 미만으로 감소하여 정밀도 향상과 중복 트랙 감소를 입증한다.
  • 시각화 결과 PatchTrack가 TransTrack 대비 ID 전환 수를 줄이고, 완전한 가림 후 재진입 상황에서도 더 나은 성능을 보임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.