Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-supervised Video Anomaly Detection with Robust Temporal Feature Magnitude Learning

Yu Tian, Guansong Pang|arXiv (Cornell University)|2021. 01. 25.
Anomaly Detection Techniques and Applications인용 수 5
한 줄 요약

이 논문은 약한 감독 비디오 이상 탐지에 적합한 새로운 방법인 강건한 시간적 특징 크기(RTFM) 학습을 제안한다. 이 방법은 이상 스퍼널이 희귀한 경우를 더 잘 식별할 수 있도록 특징 크기를 학습하여 MIL 기반 모델의 성능을 향상시킨다. RTFM는 이상 비디오 내 정상 스퍼널에 대해 강건성을 향상시키며, 상하이 테크, 유시피 크라임, XD-바이올런스, UCSD-페드스 네 가지 벤치마크에서 최신 기술 수준의 성능을 달성한다. 특히 미세한 이상 탐지 능력과 샘플 효율성이 향상된다.

ABSTRACT

Anomaly detection with weakly supervised video-level labels is typically formulated as a multiple instance learning (MIL) problem, in which we aim to identify snippets containing abnormal events, with each video represented as a bag of video snippets. Although current methods show effective detection performance, their recognition of the positive instances, i.e., rare abnormal snippets in the abnormal videos, is largely biased by the dominant negative instances, especially when the abnormal events are subtle anomalies that exhibit only small differences compared with normal events. This issue is exacerbated in many methods that ignore important video temporal dependencies. To address this issue, we introduce a novel and theoretically sound method, named Robust Temporal Feature Magnitude learning (RTFM), which trains a feature magnitude learning function to effectively recognise the positive instances, substantially improving the robustness of the MIL approach to the negative instances from abnormal videos. RTFM also adapts dilated convolutions and self-attention mechanisms to capture long- and short-range temporal dependencies to learn the feature magnitude more faithfully. Extensive experiments show that the RTFM-enabled MIL model (i) outperforms several state-of-the-art methods by a large margin on four benchmark data sets (ShanghaiTech, UCF-Crime, XD-Violence and UCSD-Peds) and (ii) achieves significantly improved subtle anomaly discriminability and sample efficiency. Code is available at https://github.com/tianyu0207/RTFM.

연구 동기 및 목표

  • 비디오 수준에서만 레이블링된 비디오에서 희귀한 이상 스퍼널을 탐지하는 과제를 해결하며, 이는 정상 스퍼널이 지배적이고 이상 사건을 가림으로써 어려움을 초래한다.
  • 특히 미세한 이상에 대해 이상 비디오의 부정적 인스턴스에 대한 다중 인스턴스 학습(MIL) 방법의 강건성을 향상시키기.
  • 확장된 컨볼루션과 자기주의 기반 기법을 사용해 짧고 긴 시간적 의존성을 모두 포착함으로써 특징 학습을 향상시키기.
  • 분류 점수보다 특징 크기를 더 강력한 훈련 신호로 사용함으로써 이상 비디오 데이터의 보다 효과적인 활용을 가능하게 하기.
  • 기존 최신 기술 수준의 방법에 비해 미세한 이상에 대한 분류 능력 향상과 더 높은 샘플 효율성 달성하기.

제안 방법

  • 비디오 스퍼널을 스칼라 크기로 매핑하는 특징 크기 학습 함수를 제안하며, 높은 크기는 이상을, 낮은 크기는 정상을 나타낸다.
  • 비디오 스퍼널 내 짧고 긴 시간적 의존성을 모델링하기 위해 확장된 컨볼루션과 자기주의 기반 메커니즘을 통합한다.
  • 상위-k 인스턴스 기반 MIL 기반 훈련 목표를 설정하여 상위-k 이상 스퍼널과 정상 스퍼널의 평균 특징 크기 간의 차이를 최대화한다.
  • 특징 크기 학습과 MIL 분류를 동시에 최적화하여 특징 공간 내에서 정상과 이상 스퍼널 간의 큰 간격을 확보한다.
  • 특징의 ℓ₂-노름을 이상도 점수의 대체로 사용하여, 이상이 미세한 경우에도 효과적인 탐지가 가능하게 한다.
  • 상위-k 이상 스퍼널의 평균 크기가 정상 스퍼널보다 높아야 한다는 이론적 기반을 가진 프레임워크를 설계한다. 이는 더 나은 분리 가능성 보장.

실험 결과

연구 질문

  • RQ1특징 크기 학습은 이상 비디오 내 지배적인 정상 스퍼널에 대해 MIL 기반 비디오 이상 탐지의 강건성을 향상시킬 수 있는가?
  • RQ2짧고 긴 시간적 의존성을 포착함으로써 약한 감독 환경에서 미세한 이상의 분류 능력이 향상되는가?
  • RQ3특징 크기가 분류 점수보다 이상 인스턴스 식별을 위한 더 강력한 훈련 신호가 될 수 있는가?
  • RQ4기존 최신 기술 수준의 방법에 비해 RTFM은 희귀하거나 미세한 이상 탐지 및 샘플 효율성에서 얼마나 향상되는가?
  • RQ5실제 데이터셋에서 상위-k 이상 스퍼널의 평균 특징 크기가 정상 스퍼널보다 높다는 가정이 경험적으로 타당한가?

주요 결과

  • RTFM는 상하이 테크에서 97.21% AUC, 유시피 크라임에서 84.30% AUC를 기록하여 베이스라인 및 최신 기술 수준의 방법을 크게 능가한다.
  • 절단 실험 결과, 특징 크기(FM) 모듈만 추가해도 상하이 테크에서 AUC가 7% 이상, 유시피 크라임에서 4% 이상 향상되어 그 강력한 영향을 입증한다.
  • FM에 확장된 컨볼루션(PDC)과 시간적 자기주의(TSA)를 조합하면 상하이 테크에서 92.32% AUC, 유시피 크라임에서 82.12% AUC를 달성하여 상호 보완적 이점이 있음을 보여준다.
  • 경험적 검증 결과, 상위-k 이상 스퍼널의 평균 특징 크기(53.4)가 정상 스퍼널의 평균 크기(7.7)보다 유의미하게 높게 나타나 이론적 가정의 타당성을 뒷받침한다.
  • 모델은 시각적 차이가 미미한 경우에도 도난 및 상점 훔치기와 같은 다수의 이상 행동을 한 번의 비디오에서 성공적으로 탐지한다.
  • 이상 스퍼널(평균 0.85)과 정상 스퍼널(평균 0.13) 간의 이상도 점수에 큰 간격이 존재하여 특징 공간 내 효과적인 분리가 이루어졌음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.