Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Unsupervised Video Anomaly Detection by Multi-Path Frame Prediction

Xuanzhao Wang, Zhengping Che|arXiv (Cornell University)|2020. 11. 05.
Anomaly Detection Techniques and Applications참고 문헌 62인용 수 11
한 줄 요약

이 논문은 다중 경로 ConvGRU 기반 프레임 예측 네트워크를 사용하여 다중 척도 공간-시간 특징을 캡처하고, 배경 노이즈의 간섭을 줄이기 위한 노이즈 내성 손실을 적용한, 강건한 비지도 비디오 이상 탐지 방법인 ROADMAP을 제안한다. 이 방법은 CUHK Avenue 데이터셋에서 88.3%의 프레임 수준 AUROC를 달성하여 최신 기술을 능가한다.

ABSTRACT

Video anomaly detection is commonly used in many applications such as security surveillance and is very challenging.A majority of recent video anomaly detection approaches utilize deep reconstruction models, but their performance is often suboptimal because of insufficient reconstruction error differences between normal and abnormal video frames in practice. Meanwhile, frame prediction-based anomaly detection methods have shown promising performance. In this paper, we propose a novel and robust unsupervised video anomaly detection method by frame prediction with proper design which is more in line with the characteristics of surveillance videos. The proposed method is equipped with a multi-path ConvGRU-based frame prediction network that can better handle semantically informative objects and areas of different scales and capture spatial-temporal dependencies in normal videos. A noise tolerance loss is introduced during training to mitigate the interference caused by background noise. Extensive experiments have been conducted on the CUHK Avenue, ShanghaiTech Campus, and UCSD Pedestrian datasets, and the results show that our proposed method outperforms existing state-of-the-art approaches. Remarkably, our proposed method obtains the frame-level AUROC score of 88.3% on the CUHK Avenue dataset.

연구 동기 및 목표

  • 이상이 드물고 레이블이 없는 감시 환경에서 비지도 비디오 이상 탐지 문제를 해결하기 위해.
  • 재구성 기반 방법이 정상 프레임과 비정상 프레임 간 재구성 오차의 차이가 부족하여 이를 구분하지 못하는 문제를 개선하기 위해.
  • 복잡한 공간-시간 의존성을 모델링하고 노이즈 간섭을 줄임으로써 예측 기반 방법을 향상시키기 위해.
  • 다양한 입력 크기, 프레임 수, 실시간 추론 제약 조건에 강건한 방법을 개발하기 위해.

제안 방법

  • 모델은 비디오의 다중 해상도 및 객체 척도에서 공간-시간 의존성을 효과적으로 캡처하기 위해 비국소 블록을 통합한 다중 경로 ConvGRU 아키텍처를 사용한다.
  • 각 경로는 다른 척도에서 특징 맵을 처리하여 의미적으로 유의미한 객체와 배경의 일관성을 효과적으로 모델링할 수 있다.
  • 학습 중에 랜덤 픽셀 수준의 노이즈가 예측 정확도에 미치는 영향을 억제하기 위해 새로운 노이즈 내성 손실을 도입한다.
  • 모델은 정상 비디오 프레임만으로 학습되며, 프레임 예측 오차를 통해 비지도 이상 탐지가 가능하다.
  • 숨은 상태를 다중 프레임 간에 재사용함으로써 효율적인 추론을 지원하여 성능 저하 없이 계산 시간을 절감한다.
  • 초기화 수치의 민감도 분석을 통해 속도-정확도 트레이드오���을 고려한 입력 프레임 수(P=8), 입력 크기(256×256), 예측 길이(Q)를 최적화한다.

실험 결과

연구 질문

  • RQ1단일 경로 또는 재구성 기반 모델에 비해 다중 경로 프레임 예측 네트워크가 감시 비디오의 공간-시간 역학을 더 잘 모델링할 수 있는가?
  • RQ2노이즈 내성 손실을 도입함으로써 배경 노이즈가 존재하는 상황에서 이상 탐지의 강건성이 어떻게 향상되는가?
  • RQ3실시간 배포를 고려할 때 입력 프레임 수, 입력 해상도, 추론 속도 사이의 최적의 균형은 무엇인가?
  • RQ4숨은 상태 재사용이 성능 저하 없이 추론 효율을 얼마나 향상시킬 수 있는가?

주요 결과

  • 제안된 방법은 CUHK Avenue 데이터셋에서 88.3%의 프레임 수준 AUROC를 달성하여 기존 최신 기술을 초월한다.
  • P=8 입력 프레임을 사용할 경우 정확도와 추론 속도 사이의 최적의 트레이드오프를 달성하며, 프레임당 약 109ms의 실행 시간을 기록한다.
  • Q=24 프레임 동안 예측을 재사용할 경우 Avenue에서 87.5%의 AUROC를 유지하면서도 32.2 fps를 달성하여 실시간 요구 조건을 충족한다.
  • 입력 크기를 128×128로 줄일 경우 Avenue에서 AUROC가 6.0 포인트 감소하여 해상도에 민감한 것으로 나타났다.
  • 입력 크기를 384×384로 늘일 경우 추론 시간이 두 배로 증가하고, Avenue에서 AUROC가 1.0 포인트 감소하여 수익 감소 현상이 나타났다.
  • 노이즈 내성 손실은 특히 픽셀 수준의 변동으로 인한 잡음이 많은 배경 환경에서 거짓 경고를 줄여 잡음 간섭에 대한 강건성을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.