Skip to main content
QUICK REVIEW

[논문 리뷰] A Large Scale Urban Surveillance Video Dataset for Multiple-Object Tracking and Behavior Analysis

Guojun Yin, Bin Liu|arXiv (Cornell University)|2019. 04. 26.
Video Surveillance and Tracking Methods참고 문헌 22인용 수 5
한 줄 요약

이 논문은 16개의 혼잡한 도시 환경(7개의 실외 환경)을 포함하는 대규모 실생활 기준 데이터셋인 도시 감시 영상 데이터셋(USVD)을 소개한다. 이 데이터셋에는 20만 개 이상의 애너테이션 프레임, 370만 개 이상의 바운딩 박스, 7,100개의 트래잭터리가 포함되어 있으며, 복잡하고 현실적인 조건에서 다중 객체 추적 및 이질성 탐지 알고리즘의 엄격한 평가를 가능하게 한다. 이는 혼잡한 도시 환경에서 최신 기술의 성능에 상당한 과제를 제기한다.

ABSTRACT

Multiple-object tracking and behavior analysis have been the essential parts of surveillance video analysis for public security and urban management. With billions of surveillance video captured all over the world, multiple-object tracking and behavior analysis by manual labor are cumbersome and cost expensive. Due to the rapid development of deep learning algorithms in recent years, automatic object tracking and behavior analysis put forward an urgent demand on a large scale well-annotated surveillance video dataset that can reflect the diverse, congested, and complicated scenarios in real applications. This paper introduces an urban surveillance video dataset (USVD) which is by far the largest and most comprehensive. The dataset consists of 16 scenes captured in 7 typical outdoor scenarios: street, crossroads, hospital entrance, school gate, park, pedestrian mall, and public square. Over 200k video frames are annotated carefully, resulting in more than 3:7 million object bounding boxes and about 7:1 thousand trajectories. We further use this dataset to evaluate the performance of typical algorithms for multiple-object tracking and anomaly behavior analysis and explore the robustness of these methods in urban congested scenarios.

연구 동기 및 목표

  • 다중 객체 추적 및 행동 분석 알고리즘 평가를 위한 대규모, 현실적, 복잡한 도시 감시 데이터셋의 부족을 해결하기 위해.
  • 실제 도시의 혼잡함, 가림, 다양한 객체 간 상호작용을 반영하는 기준을 제공하기 위해.
  • 어려운 현실적인 도시 환경에서 기존 추적 및 이질성 탐지 방법의 강건성 평가를 위해.
  • 공공 안전 및 스마트 시티 응용을 위한 더 정확하고 일반화 능력이 뛰어난 컴퓨터 비전 모델 개발을 지원하기 위해.

제안 방법

  • 데이터셋은 도시의 대표적인 실외 환경 7개(거리, 교차로, 병원 입구, 학교 정문, 공원, 보행자 전용 거리, 공원 광장)에서 실존하는 감시 카메라를 통해 수집되었다.
  • 20만 개 이상의 영상 프레임이 수작업으로 바운딩 박스, 객체 카테고리, 가림 수준, 트래잭터리 식별자 등으로 애너테이션 처리되었다.
  • 유사한 속도와 방향으로 함께 움직이는 최소 두 명 이상의 보행자를 나타내기 위해 '그룹'이라는 새로운 객체 클래스를 도입하였다.
  • 다중 객체 추적(예: TC_ODAL, SORT, IOU) 및 이질성 탐지(예: HMOF, PT-HOF, SL-MHOF)를 위한 기준 방법을 평가하기 위해 데이터셋이 사용되었다.
  • 평가 지표로는 추적 정확도 평가를 위한 MOTA, 이질성 탐지 성능 평가를 위한 EER, AUC, ROC 곡선이 사용되었다.
  • 시험 세트는 학습용 10개 시퀀스(시퀀스당 200 프레임), 테스트용 10개 시퀀스로 구성되었으며, 달리기, 점프, 자전거 타기 등의 행동을 중심으로 하였다.

실험 결과

연구 질문

  • RQ1고밀도 및 가림이 심한 현실적인 도시 감시 영상 데이터셋에서 최신 기술의 다중 객체 추적 알고리즘이 어떻게 성능을 발휘하는가?
  • RQ2다양하고 모호한 행동을 포함한 복잡한 현실 도시 환경에서 기존의 이질성 탐지 방법은 어느 정도 일반화되는가?
  • RQ3그룹 수준의 애너테이션 포함이 혼잡한 도시 환경에서 보행자 상호작용 모델링에 어떻게 기여하는가?
  • RQ4현실적이고 대규모 도시 영상 데이터에 적용했을 때 현재 추적 및 이질성 탐지 시스템의 주요 실패 원인은 무엇인가?

주요 결과

  • USVD 데이터셋은 16개의 시퀀스, 211,706개의 애너테이션 프레임, 3,758,821개의 바운딩 박스, 7,173개의 고유한 트래잭터리를 포함하여 현재까지 가장 크고 종합적인 도시 감시 데이터셋이다.
  • SORT 및 IOU와 같은 기준 추적 방법은 단순 기준과 비교해 USVD에서 성능이 저하되었으며, 이는 가림과 밀도로 인한 높은 과제 수준을 반영한다.
  • HMOF 및 SL-MHOF와 같은 이질성 탐지 방법은 중간 수준의 AUC 및 EER 점수를 기록했지만, 성능 격차가 여전히 존재하여 실제 도시 환경에서 드문 또는 모호한 행동을 탐지하는 데의 과제를 드러낸다.
  • 그림 7의 ROC 곡선은 최고 성능의 방법조차도 USVD에서 높은 AUC와 낮은 EER를 달성하기 어려운 점을 보여주며, 데이터셋의 현실성과 난이도를 확인한다.
  • 그룹 애너테이션의 포함은 집단적 보행자 운동 모델링이 혼잡한 군중에서 추적의 강건성을 향상시킨다는 점을 드러내었으며, 향후 방법에서 그룹 수준의 역학을 통합할 필요성이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.