Skip to main content
QUICK REVIEW

[논문 리뷰] MMPTRACK: Large-scale Densely Annotated Multi-camera Multiple People Tracking Benchmark

Xiaotian Han, Quanzeng You|arXiv (Cornell University)|2021. 11. 30.
Video Surveillance and Tracking Methods참고 문헌 41인용 수 13
한 줄 요약

이 논문은 밀도 높은 2D 및 3D 애너테이션을 갖춘 가장 큰 공개 가능한 다중 카메라, 다중 인체 추적 벤치마크인 MMPTRACK를 소개한다. 校정된 깊이 및 RGB 카메라를 사용하여 고품질의 3D 추적 결과를 자동 생성하고, 이를 2D 뷰로 투영한 후 수동으로 보완함으로써 수동 애너테이션 비용의 1/800에 불과한 비용으로 100% IDF1 및 99.9% MOTA를 달성한다.

ABSTRACT

Multi-camera tracking systems are gaining popularity in applications that demand high-quality tracking results, such as frictionless checkout because monocular multi-object tracking (MOT) systems often fail in cluttered and crowded environments due to occlusion. Multiple highly overlapped cameras can significantly alleviate the problem by recovering partial 3D information. However, the cost of creating a high-quality multi-camera tracking dataset with diverse camera settings and backgrounds has limited the dataset scale in this domain. In this paper, we provide a large-scale densely-labeled multi-camera tracking dataset in five different environments with the help of an auto-annotation system. The system uses overlapped and calibrated depth and RGB cameras to build a high-performance 3D tracker that automatically generates the 3D tracking results. The 3D tracking results are projected to each RGB camera view using camera parameters to create 2D tracking results. Then, we manually check and correct the 3D tracking results to ensure the label quality, which is much cheaper than fully manual annotation. We have conducted extensive experiments using two real-time multi-camera trackers and a person re-identification (ReID) model with different settings. This dataset provides a more reliable benchmark of multi-camera, multi-object tracking systems in cluttered and crowded environments. Also, our results demonstrate that adapting the trackers and ReID models on this dataset significantly improves their performance. Our dataset will be publicly released upon the acceptance of this work.

연구 동기 및 목표

  • 복잡하고 혼잡한 환경에서의 다중 카메라 다중 인체 추적 데이터셋이 부족한 문제를 해결한다.
  • 다중 카메라 환경에서 수동 애너테이션의 높은 비용과 난이도를 해결하기 위해 확장 가능한 자동 애너테이션 파이프라인을 제안한다.
  • 실세계 시나리오에서 다중 카메라 추적 및 인체 재식별(ReID) 시스템을 평가하고 향상시키기 위한 벤치마크를 제공한다.
  • MMPTRACK에서 도메인 특화 미세조정이 일반 데이터셋에서 사전 훈련된 모델에 비해 추적기 및 ReID 성능을 크게 향상시킴을 보여준다.
  • 복잡한 가림과 조명 변화가 있는 환경, 예를 들어 유통점, 사무실, 로비에서의 일반화 및 강인성을 향상시키기 위해 가능하게 한다.

제안 방법

  • 다섯 가지 다양한 실세계 환경(Cafe, Industry, Lobby, Office, Retail)에 다수의 校정된 깊이 센서와 RGB 카메라를 설치한다.
  • 깊이 데이터를 사용하여 3D 공간의 정상 시각 투영된 위에서 본 시점에서 상향식 3D 인체 검출기 및 추적기를 훈련시킨다.
  • 3D 추적기를 사용하여 모든 프레임에서 가짜 지상 진실(가짜 3D 추적 결과)을 생성한다.
  • 카메라 캘리브레이션 파rameters를 사용하여 3D 추적 결과를 동기화된 각 RGB 카메라 뷰로 투영한다.
  • 3D 추적 결과의 품질을 수동으로 점검하여 ID 전환 및 거짓 양성 결과를 수정함으로써 높은 레이블 정확도를 확보한다.
  • 최종적으로 생성된 밀도 높은 2D 및 3D 애너테이션을 활용하여 다중 카메라 추적기 및 ReID 모델을 훈련 및 평가한다.

실험 결과

연구 질문

  • RQ1깊이 및 RGB 카메라를 사용한 자동 애너테이션 시스템이 전통적 수동 레이블링 비용의 일부분으로도 고품질의 확장 가능한 다중 카메라 추적 애너테이션을 생성할 수 있는가?
  • RQ2복잡한 가림이 있는 다양한 실세계 환경에서 최신 다중 카메라 추적기 및 ReID 모델의 성능은 어떻게 변화하는가?
  • RQ3MS-COCO나 OpenImages와 같은 일반 데이터셋에서 사전 훈련된 모델에 비해 MMPTRACK에서의 미세조정이 성능 향상에 얼마나 기여하는가?
  • RQ4혼잡하고 혼잡한 환경에서 ReID 및 추적 성능에 도메인 특화 데이터가 미치는 영향은 어떠한가?
  • RQ5대규모의 도메인 내 데이터가 도메인 갭을 완화하고 다중 카메라 추적 시스템의 일반화 능력을 향상시킬 수 있는가?

주요 결과

  • 자기 애너테이션 시스템은 수동 레이블링 비용의 1/800에 불과한 비용으로 100% IDF1 및 99.9% MOTA를 달성한다.
  • MMPTRACK에서 미세조정된 ReID 모델은 일반화 모델 및 OpenImages에서 사전 훈련된 모델보다 성능이 뛰어나며, 특히 유통점과 같은 혼잡한 환경에서 두드러진다.
  • MMPTRACK에서부터 사전 훈련 없이 모델을 훈련시키면 일반화 모델보다 성능이 뛰어나며, 이는 도메인 내 데이터가 도메인 불일치 데이터에서의 사전 훈련보다 더 효과적임을 시사한다.
  • ReID 모델의 성능은 유통점 환경에서 크게 떨어지며(mAP: 28.46), 혼잡한 배경과 가림이 주요 과제임을 보여준다.
  • 심지어 최신 실시간 다중 카메라 추적기조차도 무마찰 체크아웃과 같은 요구 수준 높은 애플리케이션의 정확도 기준을 충족하지 못한다.
  • MMPTRACK의 훈련 세트를 사용한 모델 적응은 성능 향상에 상당한 기여를 하며, 실세계 배포에 있어 대규모 도메인 특화 데이터의 가치를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.