Skip to main content
QUICK REVIEW

[논문 리뷰] Video Abnormal Event Detection by Learning to Complete Visual Cloze Tests

Siqi Wang, Guang Yu|arXiv (Cornell University)|2021. 08. 05.
Anomaly Detection Techniques and Applications참고 문헌 74인용 수 6
한 줄 요약

이 논문은 시각적 빈칸 채우기(Visual Cloze Completion, VCC)를 제안하며, 이는 비디오 이상행동 탐지(VAD)를 시각적 빈칸 테스트(VCT)를 완성하는 방식으로 포지셔닝하는 새로운 비디오 이상행동 탐지(VAD) 방법이다. 시간-공간 큐브(STC)에 비침의 외관과 운동 특징을 이용해 이상행동를 국소화하고, VCT를 만들기 위해 일부 영역을 제거한 후, 손실된 영역과 광학 흐름을 재구성하도록 딥 네트워크를 훈련시킴으로써, 다양한 벤치마크에서 최고 성능을 달성하며 국소화 정밀도와 종합적 맥락 모델링이 향상된다.

ABSTRACT

Although deep neural networks (DNNs) enable great progress in video abnormal event detection (VAD), existing solutions typically suffer from two issues: (1) The localization of video events cannot be both precious and comprehensive. (2) The semantics and temporal context are under-explored. To tackle those issues, we are motivated by the prevalent cloze test in education and propose a novel approach named Visual Cloze Completion (VCC), which conducts VAD by learning to complete "visual cloze tests" (VCTs). Specifically, VCC first localizes each video event and encloses it into a spatio-temporal cube (STC). To achieve both precise and comprehensive localization, appearance and motion are used as complementary cues to mark the object region associated with each event. For each marked region, a normalized patch sequence is extracted from current and adjacent frames and stacked into a STC. With each patch and the patch sequence of a STC compared to a visual "word" and "sentence" respectively, we deliberately erase a certain "word" (patch) to yield a VCT. Then, the VCT is completed by training DNNs to infer the erased patch and its optical flow via video semantics. Meanwhile, VCC fully exploits temporal context by alternatively erasing each patch in temporal context and creating multiple VCTs. Furthermore, we propose localization-level, event-level, model-level and decision-level solutions to enhance VCC, which can further exploit VCC's potential and produce significant performance improvement gain. Extensive experiments demonstrate that VCC achieves state-of-the-art VAD performance. Our codes and results are open at https://github.com/yuguangnudt/VEC_VAD/tree/VCC.

연구 동기 및 목표

  • 기존의 딥 네트워크 기반 VAD 방법이 이상행동를 정밀하고 종합적으로 국소화하는 데에 한계를 보이고 있는 문제를 해결한다.
  • 현재의 VAD 접근 방식에서 비디오 의미와 시간적 맥락이 충분히 활용되지 않는 문제를 해결한다.
  • 자기지도 학습 틀을 개발하여 시각적 빈칸 테스트를 활용해 정상 비디오 패턴을 암묵적으로 학습한다.
  • 국소화, 이상행동, 모델, 결정 수준에서의 다중 수준 앙상블 전략을 통해 VAD 성능을 향상시킨다.
  • 이상행동 애너테이션을 필요로 하지 않고도 효과적인 이상행동 탐지를 가능하게 하며, 일종의 분류 원칙에 부합한다.

제안 방법

  • 외관과 운동을 보완적 특징으로 사용하여 비디오 이상행동를 정밀하고 종합적인 관심 영역(RoI) 제안으로 국소화한다.
  • 검출된 RoI 주변의 정규화된 패치 시퀀스를 스택하여 시간-공간 큐브(STC)를 추출한다.
  • 각 STC에서 중심 패치(및 그 광학 흐름)를 의도적으로 제거하여 시각적 빈칸 테스트(VCT)를 생성한다.
  • 손실된 패치와 광학 흐름을 재구성하도록 별도의 딥 네트워크(ST-UNets)를 훈련시어 비디오 의미를 완성 과정을 통해 학습한다.
  • 다른 시간적 위치에서 패치를 제거하여 다양한 유형의 VCT를 생성함으로써 시퀀스 전반의 시간적 맥락을 활용한다.
  • 모odal 및 모델 앙상블 전략—VCT 유형 앙상블 및 모달리티 앙상블—을 적용하여 정확도와 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1이상행동 학습 데이터 없이도 시각적 빈칸 채우기를 효과적으로 활용해 정상 비디오 패턴을 학습하여 이상행동 탐지에 활용할 수 있는가?
  • RQ2슬라이딩 윈도우 또는 프레임 수준의 접근 방식과 비교해 VCC 방법이 국소화 정밀도와 종합성에서 어떻게 향상되는가?
  • RQ3손실된 패치와 광학 흐름을 재구성하는 과정이 VAD에서 의미적 및 시간적 맥락 이해를 어느 정도 향상시키는가?
  • RQ4국소화, 이상행동, 모델, 결정 수준의 다중 수준 앙상블 전략이 VCC의 성능 향상에 기여하는 정도는 어떠한가?
  • RQ5VCC는 프레임 수준과 픽셀 수준의 이상행동 탐지 벤치마크에서 기존 최고 수준의 방법을 초월할 수 있는가?

주요 결과

  • VCC는 UCSD Ped2, Avenue, ShanghaiTech 데이터셋에서 최고 성능을 달성하며, 프레임 수준과 픽셀 수준 평가 지표에서 이전 방법들을 모두 능가한다.
  • 정상 행위에 대해 재구성 오차를 크게 감소시켰으며, 완성 오차는 물체 윤곽 주변에 균일하게 분포해 있는 반면, 이상행동에서는 고차원 물체 부분에 날카롭고 집중된 오차를 보인다.
  • 절단 실험을 통해 VCT를 표준 재구성 방식으로 대체할 경우 AUC가 3%~7% 감소함을 확인하여, 빈칸 테스트 포지셔닝의 필요성을 검증한다.
  • UCSD Ped2에서는 프레임당 평균 추론 비용이 0.16초, Avenue에서는 0.19초, ShanghaiTech에서는 0.21초로, 수용 가능한 계산 효율성을 보여준다.
  • 비디오 이상행동 추출 단계가 주요 계산 병목 현상이지만, 독립적인 ST-UNet 모델의 병렬 처리를 통해 추가 가속화가 가능하다.
  • 시각화 결과에 따르면 이상행동에 대한 완성 오차는 의미적으로 해석 가능하며, 종종 다리, 가방, 던진 물체와 같이 잘못 분류되거나 왜곡된 물체 부분에 집중되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.