Skip to main content
QUICK REVIEW

[논문 리뷰] MIST: Multiple Instance Self-Training Framework for Video Anomaly Detection

Jia-Chang Feng, Fa-Ting Hong|arXiv (Cornell University)|2021. 04. 04.
Anomaly Detection Techniques and Applications참고 문헌 37인용 수 19
한 줄 요약

MIST는 비디오 이상 탐지에 대해 약한 감독 학습을 위한 다중 인스턴스 자기학습 프레임워크를 제안하며, 가짜 레이블 생성을 위한 희박한 연속 샘플링 전략과 이상 영역을 강조하기 위한 자기가이드드 어텐션 모듈을 사용하여 분류 특징 학습을 향상시킨다. 이는 기존 방법보다 더 빠른 추론 속도와 낮은 FLOPs를 기록하면서도 최신 기술 수준의 성능을 달성하여 상海공과대학 데이터셋에서 94.83%의 프레임 수준 AUC를 달성한다.

ABSTRACT

Weakly supervised video anomaly detection (WS-VAD) is to distinguish anomalies from normal events based on discriminative representations. Most existing works are limited in insufficient video representations. In this work, we develop a multiple instance self-training framework (MIST)to efficiently refine task-specific discriminative representations with only video-level annotations. In particular, MIST is composed of 1) a multiple instance pseudo label generator, which adapts a sparse continuous sampling strategy to produce more reliable clip-level pseudo labels, and 2) a self-guided attention boosted feature encoder that aims to automatically focus on anomalous regions in frames while extracting task-specific representations. Moreover, we adopt a self-training scheme to optimize both components and finally obtain a task-specific feature encoder. Extensive experiments on two public datasets demonstrate the efficacy of our method, and our method performs comparably to or even better than existing supervised and weakly supervised methods, specifically obtaining a frame-level AUC 94.83% on ShanghaiTech.

연구 동기 및 목표

  • 비디오 수준의 레이블만을 사용하는 약한 감독 비디오 이상 탐지(WS-VAD)의 과제를 해결하며, 이는 표현 학습을 제한한다.
  • 기존 방법에서의 노이즈가 많은 가짜 레이블 문제를 해결하기 위해 다중 인스턴스 학습(MIL) 프레임워크를 활용해 클립 수준의 레이블을 정밀하게 보정한다.
  • 외부 레이블 없이도 이상 영역에 적응적으로 집중하는 작업 특화 특징 인코더를 개발한다.
  • 두 단계 자기학습 기반의 프로세스를 통해 가짜 레이블 생성과 특징 인코딩을 동시에 최적화하여 효율성과 정확도를 향상시킨다.
  • 실시간 스트리밍 비디오에서 높은 탐지 성능를 유지하면서 도메인 갭과 계산 비용을 줄인다.

제안 방법

  • 이상 비디오의 더 신뢰할 수 있는 클립 수준 가짜 레이블 생성을 위해 희박한 연속 샘플링 전략을 사용하는 다중 인스턴스 가짜 레이블 생성기 제안.
  • 클립 수준의 레이블과 가짜 레이블을 활용해 이상 영역을 동적으로 강조하는 자기가이드드 어텐션 강화 특징 인코더(E_SGA) 도입.
  • 희박-연속 샘플링을 통한 깊은 MIL 순위 손실를 적용하여 이상 클립 주변의 맥락적 단서에 초점을 맞춰 가짜 레이블의 품질을 향상시킨다.
  • 두 단계 자기학습 프로세스를 적용: 먼저 사전 학습된 인코더로부터 가짜 레이블을 생성하고, 이후 정상 및 가짜 레이블이 부여된 이상 비디오를 사용해 특징 인코더를 정밀하게 보정한다.
  • 반복 최적화를 피하기 위해 최소-최대 정규화와 시간적 스무딩 등의 후처리 기법을 활용해 레이블 노이즈를 감소시킨다.
  • 대용량 배치 크기를 활용한 그래디언트 누적 기법을 적용해 훈련 중 레이블 노이즈를 추가로 억제한다.
Figure 1: Our proposed MIST first assign clip-level pseudo labels $\hat{Y}^{a}=\{\hat{y}^{a}_{i}\}$ to anomaly videos with the help of a pseudo label generator $G$ . Then, MIST leverages information from all videos to refine a self-guided attention boosted feature encoder $E_{SGA}$ .
Figure 1: Our proposed MIST first assign clip-level pseudo labels $\hat{Y}^{a}=\{\hat{y}^{a}_{i}\}$ to anomaly videos with the help of a pseudo label generator $G$ . Then, MIST leverages information from all videos to refine a self-guided attention boosted feature encoder $E_{SGA}$ .

실험 결과

연구 질문

  • RQ1비디오 수준의 레이블만을 사용하는 자기학습 프레임워크가 약한 감독 비디오 이상 탐지에서 특징 표현 학습을 어떻게 향상시킬 수 있는가?
  • RQ2비디오 수준의 감독에서 발생하는 노이즈를 줄이기 위해 가짜 레이블 생성 과정을 어떻게 더 견고하게 만들 수 있는가?
  • RQ3사람이 레이블링한 바운딩 박스 없이도 자기가이드드 어텐션 메커니즘이 이상 영역을 효과적으로 국소화할 수 있는가?
  • RQ4기존의 반복적 또는 종단 간 학습 전략에 비해 두 단계 자기학습 프로세스가 정확도와 효율성 측면에서 뛰어나지 않는가?
  • RQ5제안된 프레임워크는 낮은 계산 비용과 빠른 추론 속도를 유지하면서도 최신 기술 수준의 성능를 달성할 수 있는가?

주요 결과

  • MIST는 상해공과대학 데이터셋에서 94.83%의 프레임 수준 AUC를 기록하여 기존의 감독 및 약한 감독 방법을 모두 초월한다.
  • MIST-I3D 모델은 단지 45.68G FLOPs로 324.46 FPS의 속도를 기록하며, Zhong 등 [35]의 방법보다 훨씬 더 빠르고 효율적이다. Zhong 등 [35]는 10-크롭 테스트와 386.2G FLOPs를 요구한다.
  • 자기가이드드 어텐션 모듈은 시각화된 7개 사례 중 5개에서 이상 영역을 성공적으로 강조하여 공간적 어텐션의 효과를 입증한다.
  • 정밀도 향상 후 상해공과대학에서 AUC가 58.66%에서 67.14%로 +8.48% 포인트 향상되어 노이즈 감소 기법의 효과를 입증한다.
  • MIST-C3D 모델은 정밀도 향상 후 73.37%의 AUC를 기록하여 경량 백본에서도 뛰어난 성능을 보인다.
  • 특히 상해공과대학 데이터셋에서 최신 기술 수준의 방법인 Zhong 등 [35]에 비해 정확도와 추론 속도 면에서 모두 뛰어난 성능를 보였다.
Figure 2: Illustration of our proposed MIST framework. MIST includes a multiple instance pseudo label generator $G$ and self-guided attention boosted feature encoder $E_{SGA}$ followed by a weighted-classification head $H_{c}$ . We first train a $G$ and then generate pseudo labels for $E_{SGA}$ fine
Figure 2: Illustration of our proposed MIST framework. MIST includes a multiple instance pseudo label generator $G$ and self-guided attention boosted feature encoder $E_{SGA}$ followed by a weighted-classification head $H_{c}$ . We first train a $G$ and then generate pseudo labels for $E_{SGA}$ fine

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.