Skip to main content
QUICK REVIEW

[논문 리뷰] Abnormal Event Detection in Urban Surveillance Videos Using GAN and Transfer Learning

Ali Atghaei, Soroush Ziaeinejad|arXiv (Cornell University)|2020. 11. 19.
Anomaly Detection Techniques and Applications참고 문헌 14인용 수 5
한 줄 요약

이 논문은 사전 훈련된 VGG16과 광학 흐름 분석을 활용하여 공간-시간적 외관 및 운동 특징을 공동으로 모델링하는 GAN 기반의 도시 감시 영상에서의 비정상 이벤트 탐지 방법을 제안한다. 이 방법은 UCSD Peds1에서 14%의 프레임 수준 EER와 93%의 AUC를 기록하며 최신 기술 수준(SOTA) 성능을 달성하였고, UCSD Peds2에서는 프레임 수준 EER 15%와 픽셀 수준 EER 17%를 기록하여 군중 장면에서의 비정상 이벤트 탐지 및 국소화에 있어 뛰어난 정확도와 효율성을 입증한다.

ABSTRACT

Abnormal event detection (AED) in urban surveillance videos has multiple challenges. Unlike other computer vision problems, the AED is not solely dependent on the content of frames. It also depends on the appearance of the objects and their movements in the scene. Various methods have been proposed to address the AED problem. Among those, deep learning based methods show the best results. This paper is based on deep learning methods and provides an effective way to detect and locate abnormal events in videos by handling spatio temporal data. This paper uses generative adversarial networks (GANs) and performs transfer learning algorithms on pre trained convolutional neural network (CNN) which result in an accurate and efficient model. The efficiency of the model is further improved by processing the optical flow information of the video. This paper runs experiments on two benchmark datasets for AED problem (UCSD Peds1 and UCSD Peds2) and compares the results with other previous methods. The comparisons are based on various criteria such as area under curve (AUC) and true positive rate (TPR). Experimental results show that the proposed method can effectively detect and locate abnormal events in crowd scenes.

연구 동기 및 목표

  • 비정상성은 주관적이고 맥락에 따라 달라지는 도시 감시 영상에서의 비정상 이벤트 탐지(AED) 문제를 해결한다.
  • 수작업 특징에 의존하고 오염, 시점 왜곡, 높은 시간 복잡도 문제를 겪는 전통적 방법의 한계를 극복한다.
  • 공간-시간 영상 데이터에서 외관과 운동 패턴을 효과적으로 모델링하는 효율적인 딥 러닝 기반 AED 시스템을 개발한다.
  • 사전 훈련된 VGG16 네트워크를 사용해 특징 추출에 전이 학습을 적용함으로써 훈련 시간을 단축하고 모델 효율성을 향상시킨다.
  • 생성적 적대적 네트워크와 광학 흐름 기반 운동 분석을 결합하여, 프레임 수준과 픽셀 수준에서 모두 높은 탐지 정확도를 달성한다.

제안 방법

  • 두 개의 스트림을 사용하는 방식: 하나의 스트림은 전이 학습을 통해 사전 훈련된 VGG16 네트워크를 이용해 RGB 프레임을 처리하여 외관 특징을 추출한다.
  • 두 번째 스트림은 광학 흐름 이미지를 추출하여 운동 역학을 모델링하고, 이를 3차원 공간-시간 표현으로 변환한다.
  • 생성적 적대적 네트워크(GAN)를 활용하며, 판별기(Discriminator)는 사전 훈련된 VGG16의 특징을 사용해 정상 영상 패턴을 학습한다.
  • 격자 기반의 공간-시간 패치 전략을 적용하여 영상 프레임을 고정된 크기의 3차원 패치로 나누어 국소화된 이상 탐지에 활용한다.
  • 정상 영상 시퀀스에서 비지도 학습 방식으로 GAN을 훈련시어 정상 및 비정상 공간-시간 패턴을 구분하는 능력을 습득한다.
  • GAN의 생성기 재구성 오차와 판별기의 신뢰도를 결합하여 이상 프레임과 이상 픽셀을 식별한다.

실험 결과

연구 질문

  • RQ1비정상 이벤트 탐지에 있어, 외관과 운동 특징을 공동으로 모델링하는 GAN 기반 모델이 도시 감시 영상에서 효과적으로 비정상 이벤트를 탐지할 수 있는가?
  • RQ2사전 훈련된 VGG16 네트워크에서의 전이 학습이 비지도 설정에서 비정상 이벤트 탐지의 효율성과 성능을 어떻게 향상시키는가?
  • RQ3광학 흐름 기반 운동 분석을 통합할 경우, 빠른 또는 저속 운동과 같은 비정상적인 움직임 탐지에 얼마나 기여하는가?
  • RQ4기준 데이터셋에서 AUC, EER 및 계산 효율성 측면에서 제안된 방법은 최신 기술 수준의 접근법과 어떻게 비교되는가?
  • RQ5낮은 추론 시간을 유지하면서도, 동시에 프레임 수준과 픽셀 수준에서 높은 정확도의 이상 국소화를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 UCSD Peds1 데이터셋에서 14%의 프레임 수준 EER와 93%의 AUC를 기록하여, MDT(25% EER, 81% AUC) 및 AMDN(16% EER, 92% AUC)과 같은 이전 방법들을 능가한다.
  • 더 도전적인 UCSD Peds2 데이터셋에서는 프레임 수준 EER 15%와 픽셀 수준 EER 17%를 기록하여, MDT(24% 및 54%)와 AMDN(16% 및 42%)를 크게 능가한다.
  • 픽셀 수준 평가에서 뛰어난 성능을 보이며, UCSD Peds1에서는 AUC 73%를 기록하고 UCSD Peds2에서는 EER 17%를 기록하여 강력한 국소화 정확도를 입증한다.
  • VGG16에서의 전이 학습을 통해 훈련 시간이 단축되고 수렴 속도가 향상되어 전체 재학습 없이도 효율적인 특징 추출이 가능하다.
  • 표준 개인용 컴퓨터에서 프레임당 평균 추론 시간은 0.312초이며, 분류가 가장 오래 걸리는 구성 요소(0.290초)로 구성되어 있어 GPU 가속을 통해 실시간 배포 가능성을 보여준다.
  • 외관과 운동 모델링의 조합은 빠른 스케이터, 카트, 저속 자전거 기사 등 다양한 비정상 행동을 효과적으로 탐지할 수 있으며, 오염 및 시점 왜곡과 같은 도전적인 조건에서도 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.