Skip to main content
QUICK REVIEW

[논문 리뷰] Quasi-Dense Similarity Learning for Multiple Object Tracking

Jiangmiao Pang, Linlu Qiu|arXiv (Cornell University)|2020. 06. 11.
Video Surveillance and Tracking Methods참고 문헌 52인용 수 18
한 줄 요약

이 논문은 다중 객체 추적을 위한 인스턴스 유사도 학습을 향상시키기 위해 이미지 쌍 간에 수백 개의 영역 제안을 조밀하게 샘플링하는 대trastive 학습 방법인 Quasi-Dense Similarity Learning을 제안한다. 유사한 양의 양성 및 음성 샘플을 활용함으로써 추론 시 단순한 최근접 이웃 검색이 가능해지며, 최신 기술 수준의 성능을 달성한다: 외부 데이터 없이 MOT17에서 20.3 FPS에서 68.7 MOTA를 기록하고, BDD100K와 Waymo에서 ID 스위치 수를 줄이며 거의 10점의 MOTA 향상을 기록한다.

ABSTRACT

Similarity learning has been recognized as a crucial step for object tracking. However, existing multiple object tracking methods only use sparse ground truth matching as the training objective, while ignoring the majority of the informative regions on the images. In this paper, we present Quasi-Dense Similarity Learning, which densely samples hundreds of region proposals on a pair of images for contrastive learning. We can directly combine this similarity learning with existing detection methods to build Quasi-Dense Tracking (QDTrack) without turning to displacement regression or motion priors. We also find that the resulting distinctive feature space admits a simple nearest neighbor search at the inference time. Despite its simplicity, QDTrack outperforms all existing methods on MOT, BDD100K, Waymo, and TAO tracking benchmarks. It achieves 68.7 MOTA at 20.3 FPS on MOT17 without using external training data. Compared to methods with similar detectors, it boosts almost 10 points of MOTA and significantly decreases the number of ID switches on BDD100K and Waymo datasets. Our code and trained models are available at http://vis.xyz/pub/qdtrack.

연구 동기 및 목표

  • 기존의 다중 객체 추적을 위한 유사도 학습에서 희박한 지도 학습의 한계를 해결하기 위해, 정답 박스 외의 정보성 있는 이미지 영역을 효율적으로 활용하지 못하는 문제를 해결한다.
  • 이미지 쌍 간에 영역 제안을 조밀하게 샘플링하여 인스턴스 수준의 유사도 학습을 향상시키고, 더 풍부한 지도 정보와 하드 음성 샘플을 제공한다.
  • 복잡한 회귀 또는 운동 사전 지식 없이도 단순한 유사도 매칭과 최근접 이웃 검색만을 사용해 종단 간 추적 파이프라인을 구현한다.
  • 매칭 과정에서 매칭되지 않은 객체(배경)를 포함하고 양방향 일致성을 강제함으로써 ID 스위치와 오분류를 줄인다.
  • 기존 검출기와 호환되는 플러그 앤 플레이 추적 프레임워크를 구축하여 최소한의 아키텍처 변경으로도 높은 정확도를 달성한다.

제안 방법

  • 이 방법은 연속 프레임 간 수백 개의 영역 제안을 대상으로 준조밀한 매칭을 수행하며, 정답 박스와 주변 후보 영역을 모두 샘플로 사용한다.
  • 각 쿼리에 대해 다수의 양성 샘플을 처리할 수 있도록 대비 학습을 확장하여, 각 제안이 기준 이미지의 다른 모든 제안을 동시에 구분할 수 있도록 한다.
  • 현재 검출 결과, 과거 트랙 및 배경 간 매칭 점수에 대해 이중 방향 소프트맥스를 적용하여 일관성을 강제하고 오분류를 억제한다.
  • 표준 검출기인 Faster R-CNN과 통합되며, 특징 추출을 위해 경량 임bedding 헤드와 잔차 네트워크를 사용한다.
  • 추론 시에는 학습된 임베딩 공간 내에서 단순한 최근접 이웃 검색을 사용하여 이동 거리 회귀나 운동 모델링이 필요 없도록 한다.
  • 전체 시스템은 종단 간으로 훈련되어 훈련 및 배포의 단순화를 이루며 높은 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1이미지 쌍 간에 영역 제안을 조밀하게 샘플링하는 것이 희박한 지도 학습을 초월하여 다중 객체 추적의 인스턴스 유사도 학습을 향상시킬 수 있는가?
  • RQ2준조밀 대비 학습이 단순한 최근접 이웃 매칭을 통해 정확한 추적을 가능하게 하는 더 구분력 있는 특징 공간을 생성하는가?
  • RQ3운동 사전 지식이나 회귀 헤드에 의존하지 않고도 제안된 방법이 ID 스위치와 오분류를 줄일 수 있는가?
  • RQ4매칭 과정에 매칭되지 않은 객체(배경)를 포함함으로써 추적의 강건성과 일관성은 어떻게 향상되는가?
  • RQ5다양한 벤치마크인 MOT17, BDD100K, Waymo, TAO에서 플러그 앤 플레이 유사도 학습 모듈이 추적 성능 향상에 얼마나 기여하는가?

주요 결과

  • QDTrack는 외부 훈련 데이터 없이 MOT17에서 20.3 FPS에서 68.7 MOTA를 기록하며 이 벤치마크에 대해 새로운 최신 기술 수준을 수립한다.
  • BDD100K와 Waymo에서 QDTrack는 유사한 검출기를 사용한 기존 방법 대비 MOTA를 거의 10점 향상시키며, 특히 ID 스위치 수를 크게 줄였다.
  • 모든 평가된 벤치마크인 MOT, BDD100K, Waymo, TAO에서 QDTrack는 모든 기존 추적 방법을 능가한다.
  • 매칭 과정에 배경을 포함함으로써 오분류가 감소했으며, 시각화 결과에서 오분류는 주로 배경과 매칭되는 것으로 나타났다.
  • 추론 파이프라인의 단순성—임베딩 공간 내 최근접 이웃 검색에 전적으로 의존함—은 복잡한 연관 모듈 없이도 높은 추적 성능을 달성할 수 있음을 보여준다.
  • 프레임워크는 표준 검출기와 호환되며 종단 간 훈련을 가능하게 하여 전체 추적 파이프라인을 단순화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.