Skip to main content
QUICK REVIEW

[논문 리뷰] MGFN: Magnitude-Contrastive Glance-and-Focus Network for Weakly-Supervised Video Anomaly Detection

Yingxian Chen, Zhengzhe Liu|arXiv (Cornell University)|2022. 11. 28.
Anomaly Detection Techniques and Applications인용 수 7
한 줄 요약

이 논문은 약한 감독 비디오 이상 탐지에 적합한 새로운 글랑스-포커스 네트워크인 MGFN을 제안한다. 이는 먼저 전체적인 시각적 맥락을 포착하고 나서 국소적인 이상 현상에 집중하는 인간의 시각적 주의를 모방하며, 대비 손실을 통해 장면에 적응하는 특징 크기를 학습함으로써, UCF-Crime에서 86.98% AUC, XD-Violence에서 80.11% AP를 기록하여 최신 기술 수준을 초월한다.

ABSTRACT

Weakly supervised detection of anomalies in surveillance videos is a challenging task. Going beyond existing works that have deficient capabilities to localize anomalies in long videos, we propose a novel glance and focus network to effectively integrate spatial-temporal information for accurate anomaly detection. In addition, we empirically found that existing approaches that use feature magnitudes to represent the degree of anomalies typically ignore the effects of scene variations, and hence result in sub-optimal performance due to the inconsistency of feature magnitudes across scenes. To address this issue, we propose the Feature Amplification Mechanism and a Magnitude Contrastive Loss to enhance the discriminativeness of feature magnitudes for detecting anomalies. Experimental results on two large-scale benchmarks UCF-Crime and XD-Violence manifest that our method outperforms state-of-the-art approaches.

연구 동기 및 목표

  • 긴 비디오 내에서 이상을 국소화하는 데에 부족한 전반적 맥락 인식 능력으로 인해 기존의 약한 감독 비디오 이상 탐지 방법의 한계를 해결한다.
  • 단순히 크기 기반 감독에 의존할 경우, 다양한 장면 간 특징 크기의 일관성 부족이 이상 탐지 성능을 떨어뜨리는 문제를 해결한다.
  • 정상 및 비정상 이벤트를 더 잘 분리할 수 있도록, 장면에 적응하는 특징 크기 분포를 학습함으로써 특징의 구분 능력을 향상시킨다.
  • 전체적인 시간적 맥락과 국소적인 공간적 세부 정보를 통합하는 통합 프레임워크를 개발하여 더 정확하고 강력한 이상 국소화를 가능하게 한다.

제안 방법

  • 전체 비디오 시퀀스를 처리하여 장기적인 시간적 맥락을 포착하는 (글랑스) 단계를 거친 후, 국소 세그먼트에서 검출를 정밀화하는 (포커스) 단계를 거치는 글랑스-포커스(GF) 네트워크 아키텍처를 제안한다.
  • 특징 크기 변화에 대한 민감도를 향상시켜 이상 탐지에 적합한 표현 학습을 개선하기 위해 특징 증폭 기법(FAM)을 도입한다.
  • 동일한 카테고리(정상 또는 비정상)의 비디오 간 특징 크기 유사도를 높이고, 서로 다른 카테고리 간의 분리 가능성을 극대화하는 크기 대비(MC) 손실을 설계한다.
  • 프레임 수준의 애너테이션 없이도, MC 손실을 활용해 감독된 비디오 레벨 정보만으로도 구분 가능한 특징 크기를 학습한다.
  • GF 모듈, FAM, MC 손실을 종합적으로 통합한 엔드 투 엔드 학습 가능한 프레임워크를 구성하여, 전반적 맥락 모델링과 국소 이상 감도를 동시에 최적화할 수 있도록 한다.
  • 전역 및 국소 특징을 별도로 처리한 후 융합하는 이중 스트림 특징 추출 전략을 사용하며, GF 기법을 통해 전역에서 국소 수준으로 정보 흐름을 효과적으로 전달한다.

실험 결과

연구 질문

  • RQ1글랑스-포커스 메커니즘이 전반적 맥락과 국소 세부 정보를 통합함으로써 긴 비디오에서 이상 국소화 성능을 향상시킬 수 있는가?
  • RQ2다양한 장면 간 특징 크기의 일관성 부족이 크기 기반 이상 탐지 방법의 성능을 떨어뜨리는가?
  • RQ3장면에 적응하는 특징 크기 분포를 학습하는 대비 손실이 정상 및 비정상 특징 간의 분리 가능성을 향상시킬 수 있는가?
  • RQ4제안된 특징 증폭 기법(FAM)이 미세하거나 낮은 크기의 이상을 탐지하는 데에 얼마나 효과적인가?
  • RQ5글랑스-포커스, FAM, MC 손실의 조합이 기존 최신 기술 수준의 방법보다 약한 감독 설정에서 어떻게 뛰어난 성능을 내는가?

주요 결과

  • MGFN은 UCF-Crime 데이터셋에서 86.98% AUC, XD-Violence 데이터셋에서 80.11% AP를 기록하여 최신 기술 수준의 방법들을 능가한다.
  • 제거 실험 결과, 글랑스-포커스 메커니즘을 추가함으로써 UCF-Crime에서 AUC가 82.66%(FF)에서 85.80%로 향상되었으며, 전반적 및 국소 특징 통합의 효과를 입증한다.
  • 특징 증폭 기법(FAM)만으로도 UCF-Crime에서 AUC가 1.65%p 상승하고, XD-Violence에서 AP가 1.02p 상승하여 특징 민감도 향상을 확인한다.
  • 크기 대비(MC) 손실만으로도 UCF-Crime에서 AUC가 2.85p 상승하고, XD-Violence에서 AP가 3.69p 상승하여 특징의 구분 능력 향상 기여를 확인한다.
  • FAM와 MC 손실을 함께 사용할 경우 최고의 성능(86.98% AUC 및 80.11% AP)을 기록하여, 두 기법이 서로 보완적으로 작용함을 보여준다.
  • 정성적 결과 분석을 통해 MGFN은 복잡한 장면에서 다수의 이상 클립이 존재하는 경우에도 정확하게 이상을 국소화하며, 역동적인 움직임이 있는 정상 비디오에서도 낮은 거짓 경고 비율을 유지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.