Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-Supervised Spatio-Temporal Anomaly Detection in Surveillance Video

Jie Wu, Wei Zhang|arXiv (Cornell University)|2021. 08. 09.
Anomaly Detection Techniques and Applications참고 문헌 26인용 수 7
한 줄 요약

이 논문은 비정상 이벤트를 비트림 영상에서 비디오 수준 레이블만을 사용하여 시공간 튜브로 국소화하는 새로운 과제인 약한 감독형 시공간 이상 탐지(WSSTAD)를 제안한다. 다중 해상도 시공간 특징을 활용하기 위해 상호 지도형 점진적 정련과 관계 추론을 통합한 이중 브랜치 네트워크를 도입하여, 두 가지 새로운 벤치마크에서 최신 기술 수준의 성능을 달성한다. ST-UCF-Crime에서 87.65% VAUC 및 8.98% MIoU, STRA에서 92.88% VAUC 및 7.23% MIoU를 기록한다.

ABSTRACT

In this paper, we introduce a novel task, referred to as Weakly-Supervised Spatio-Temporal Anomaly Detection (WSSTAD) in surveillance video. Specifically, given an untrimmed video, WSSTAD aims to localize a spatio-temporal tube (i.e., a sequence of bounding boxes at consecutive times) that encloses the abnormal event, with only coarse video-level annotations as supervision during training. To address this challenging task, we propose a dual-branch network which takes as input the proposals with multi-granularities in both spatial-temporal domains. Each branch employs a relationship reasoning module to capture the correlation between tubes/videolets, which can provide rich contextual information and complex entity relationships for the concept learning of abnormal behaviors. Mutually-guided Progressive Refinement framework is set up to employ dual-path mutual guidance in a recurrent manner, iteratively sharing auxiliary supervision information across branches. It impels the learned concepts of each branch to serve as a guide for its counterpart, which progressively refines the corresponding branch and the whole framework. Furthermore, we contribute two datasets, i.e., ST-UCF-Crime and STRA, consisting of videos containing spatio-temporal abnormal annotations to serve as the benchmarks for WSSTAD. We conduct extensive qualitative and quantitative evaluations to demonstrate the effectiveness of the proposed approach and analyze the key factors that contribute more to handle this task.

연구 동기 및 목표

  • 비디오 수준의 추상적 레이블만을 사용하여 감시 영상에서 비정상 이벤트를 국소화하는 과제를 해결하기 위해.
  • 다양한 해상도 수준에서 공간적 및 시간적 관계를 동시에 모델링하여 이상 탐지 성능을 향상시키기 위한 방법을 개발하기 위해.
  • 학습 시 개별 인스턴스 또는 튜브 수준의 레이블이 필요 없이도 세밀한 시공간 국소화를 가능하게 하기 위해.
  • 두 가지 새로운 데이터셋인 ST-UCF-Crime와 STRA를 통해 약한 감독형 시공간 이상 탐지에 대한 새로운 벤치마크를 구축하기 위해.

제안 방법

  • 다양한 시공간 해상도에서 튜브 제안을 처리하는 이중 브랜치 네트워크 아키텍처를 제안하여 다중 해상도 비정상 개념을 포괄적으로 캡처한다.
  • 다중 헤드 자기주의 기반의 관계 추론 모듈을 도입하여 객체 간 및 튜브 간 상호작용을 모델링하고, 맥락적 및 관계적 특징을 통합하여 이상 탐지에 활용한다.
  • 반복적인 정련을 위해 이중 경로 상호 지도를 활용하는 상호 지도형 점진적 정련(MGPR) 프레임워크를 제안하여 양 브랜치 간에 학습된 개념을 전달함으로써 예측을 점진적으로 개선한다.
  • 점수 붕괴를 방지하고 지도 효과를 향상시키기 위해 순서 정렬 손실($\mathcal{L}_{\textit{Rank}}$)과 교차 엔트로피 손실($\mathcal{L}_{\textit{CE}}$)을 조합한 하이브리드 손실 함수를 활용한다.
  • 교차하는 객체들을 튜브로 묶는 다변량 튜브(MVT) 모듈과 튜브 간의 동적 관계를 학습하는 관계 모델링 모듈(RMM)을 통합한다.
  • 이를 위해 다중 인스턴스 학습(MIL)의 관점에서 작업을 재정의하여, 비디오 내에서 비정상 튜브가 존재할 경우 비디오 수준 레이블로 이를 신호로 간주한다.

실험 결과

연구 질문

  • RQ1튜브 수준 또는 프레임 수준의 레이블이 전혀 없이도 약한 감독 방법이 비트림 감시 영상에서 시공간 이상을 효과적으로 국소화할 수 있는가?
  • RQ2다양한 해상도 수준의 시공간 튜브 제안을 효과적으로 활용하면 이상 탐지 성능이 어떻게 향상되는가?
  • RQ3이중 브랜치 네트워크 간의 상호 지도가 모델 정련 및 이상 국소화 정확도 향상에 얼마나 기여하는가?
  • RQ4다양한 상호작용 메커니즘(예: MVT, RMM, GCN)은 객체 간 상호작용을 포함하는 복잡한 비정상 행동 탐지에 어떤 영향을 미치는가?
  • RQ5반복 최적화 프로세스에서 한 브랜치에서 학습된 개념의 보조 지도 정보가 다른 브랜치의 정련에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 MGPR 프레임워크는 ST-UCF-Crime에서 87.65% VAUC 및 8.98% MIoU를 기록하여 기존 베이스라인 대비 유의미한 성능 향상을 달성한다.
  • STRA 데이터셋에서는 92.88% VAUC 및 7.23% MIoU를 기록하여 다양한 이상 유형에 대한 뛰어난 일반화 능력을 입증한다.
  • 시간적 또는 공간적 튜브 브랜치를 제거할 경우 성능 저하가 발생함으로써 다중 해상도 모델링의 상호 보완적 역할을 확인한다.
  • 상호 지도 손실 $\mathcal{L}_{\textit{MG-Rank}}$ 를 통한 지도 기반 정련은 단독 순서 정렬 또는 교차 엔트로피 손실 대비 성능 향상에 기여한다.
  • 관계 모델링 모듈(RMM)은 GCN 기반 접근 대비 ST-UCF-Crime에서 0.66%, STRA에서 0.79%의 MIoU 향상을 기록하여 학습된 적응형 어텐션 가중치 덕분이다.
  • 제거 실험 결과 MVT와 RMM 모두 필수적임을 입증하였으며, 이들의 제거는 심각한 성능 저하를 초래함으로써 다단계 객체 상호작용 모델링의 중요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.