[논문 리뷰] Hybrid Classifiers for Spatio-temporal Real-time Abnormal Behaviors Detection, Tracking, and Recognition in Massive Hajj Crowds
이 논문은 소규모 및 대규모 하지 군중 영상에서 비정상 행동의 실시간 감지, 추적, 식별을 위한 하이브리드 CNN-RF 프레임워크를 제안한다. 공간적 비정상 행동 감지를 위해 미세 조정된 ResNet-50를 사용하고, 운동 기반 국소화를 위해 Horn-Schunck 광학 흐름을 적용하며, 추적을 위해 칼만 필터링을 활용하고, 통계적 운동 특징에 기반한 랜덤 포레스트를 사용해 시간적 분류를 수행하여, UMN에서는 99.77%의 AUC, HAJJv2 신규 데이터셋에서는 76.08%의 AUC를 달성한다.
Individual abnormal behaviors vary depending on crowd sizes, contexts, and scenes. Challenges such as partial occlusions, blurring, large-number abnormal behavior, and camera viewing occur in large-scale crowds when detecting, tracking, and recognizing individuals with abnormal behaviors. In this paper, our contribution is twofold. First, we introduce an annotated and labeled large-scale crowd abnormal behaviors Hajj dataset (HAJJv2). Second, we propose two methods of hybrid Convolutional Neural Networks (CNNs) and Random Forests (RFs) to detect and recognize Spatio-temporal abnormal behaviors in small and large-scales crowd videos. In small-scale crowd videos, a ResNet-50 pre-trained CNN model is fine-tuned to verify whether every frame is normal or abnormal in the spatial domain. If anomalous behaviors are observed, a motion-based individuals detection method based on the magnitudes and orientations of Horn-Schunck optical flow is used to locate and track individuals with abnormal behaviors. A Kalman filter is employed in large-scale crowd videos to predict and track the detected individuals in the subsequent frames. Then, means, variances, and standard deviations statistical features are computed and fed to the RF to classify individuals with abnormal behaviors in the temporal domain. In large-scale crowds, we fine-tune the ResNet-50 model using YOLOv2 object detection technique to detect individuals with abnormal behaviors in the spatial domain.
연구 동기 및 목표
- 고밀도, 가림, 카메라 제약 등으로 인해 성능이 저하되는 대규모 하지 군중에서 비정상 행동을 감지, 추적, 식별하는 데 도전하는 문제를 해결하기 위해.
- 소규모 및 대규모 군중 환경에서 다양한 비정상 행동 유형(예: 달리기, 흐름과 반대 방향으로 걷기 등)을 구분할 수 있는 견고하고 실시간 시스템을 개발하기 위해.
- 하지 군중에서 비정상 행동 감지를 위해 특별히 설계된 새로운 대규모, 애너테이션 및 레이블이 부여된 데이터셋인 HAJJv2를 소개하기 위해.
- 딥 러닝(CNN)과 전통적 기계 학습(랜덤 포레스트)을 융합하여 공간-시간 비정상 행동 인식을 향상시켜 정확도와 일반화 능력을 향상시키기 위해.
- 공개 기준 데이터셋(UMN, UCSD)과 함께, 새로 수집한 고도로 도전적인 대규모 데이터셋(HAJJv2)에서 방법의 성능을 평가하기 위해.
제안 방법
- 소규모 영상에서 미리 훈련된 ResNet-50 CNN을 미세 조정하여 프레임 단위로 공간 영역에서 정상 또는 비정상으로 분류한다.
- Horn-Schunck 광학 흐름을 적용하여 운동 크기 및 방향 특징을 추출하고, 비정상 행동을 보이는 개인을 국소화하고 추적하기 위한 이진 마스크를 생성한다.
- 대규모 영상에서 프레임 간 개인을 예측하고 추적하기 위해 칼만 필터를 활용하여 가림 및 운동 흐림에 대한 내성을 향상시킨다.
- 각 추적 대상에 대해 운동 궤적의 평균, 분산, 표준편차와 같은 시간적 통계적 특징을 계산한다.
- 이러한 시간적 특징에 기반해 랜덤 포레스트 분류기를 훈련시켜 개인을 특정 비정상 행동 유형으로 분류한다.
- 대규모 설정에서는 고밀도 환경에서 객체 검출 정확도를 향상시키기 위해 YOLOv2와 미세 조정된 ResNet-50를 통합한다.
실험 결과
연구 질문
- RQ1하이브리드 CNN-RF 모델은 소규모 군중 영상에서 다양한 비정상 행동 유형을 실시간으로 효과적으로 감지하고 식별할 수 있는가?
- RQ2광학 흐름과 칼만 필터링의 통합은 고밀도, 가림이 빈번한 대규모 군중에서 추적의 내성을 어떻게 향상시키는가?
- RQ3공개 기준 데이터셋인 UMN과 UCSD에서 제안된 방법은 최신 기술 대비 어느 정도 뛰어나게 성능을 발휘하는가?
- RQ4극도로 도전적인 대규모 군중 데이터셋(HAJJv2)에서 모델의 성능은 얼마나 효과적인가? 특히 무거운 가림과 먼 거리의 카메라 시점에서의 성능을 고려할 때.
- RQ5통계적 운동 특징(평균, 분산, 표준편차)은 비정상 행동의 시간적 분류 정확도 향상에 어떤 역할을 하는가?
주요 결과
- UMN 기준 데이터셋에서 평균 AUC 99.77%를 달성하여 최신 기술 대비 1.67%p 높은 성능을 보였다.
- UCSD Ped1 데이터셋에서 평균 AUC 93.71%를 기록하여 최신 기술 대비 6.06%p 높은 성능을 보였다.
- UCSD Ped2 데이터셋에서 평균 AUC 98.55%를 기록하여 최신 기술 대비 2.85%p 높은 성능을 보였다.
- 대규모 군중 환경에서 HAJJv2 데이터셋에서 평균 AUC 76.08%를 달성하여, 무거운 가림과 먼 시점 등 극도로 도전적인 조건에도 불구하고 만족스러운 성능을 보였다.
- 저해상도, 카메라 각도, 그림자, 낮은 조명 등으로 인해 UCSD Ped1에서 성능이 낮게 나타났으며, 이는 영상 품질에 민감함을 시사한다.
- HAJJv2의 마사 시나리오에서는 카메라 시점이 가까워지고 가림 정도가 보통이었기 때문에 분류가 더 쉬웠고, 반면 타와프와 자마라트 시나리오는 높은 밀도와 먼 시점으로 인해 가장 도전적인 것으로 남아 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.