Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-supervised Video Anomaly Detection with Contrastive Learning of Long and Short-range Temporal Features.

Yu Tian, Guansong Pang|arXiv (Cornell University)|2021. 01. 25.
Anomaly Detection Techniques and Applications참고 문헌 44인용 수 7
한 줄 요약

이 논문은 다중 척도의 시간적 의존성을 모델링하기 위해 확장된 컨volution의 피라미드와 자기주의 기반의 어텐션 메커니즘을 결합한 MTN-KMIL을 제안한다. 이는 짧은 범위와 긴 범위의 시간적 의존성을 동시에 모델링하며, 상위 K개의 정상 및 비정상 스니펫 간의 큰 간격을 특성 수준과 점수 수준에서 강제하는 상위 K개 대비 다중 예측 학습 기반의 강화 기법을 사용하여, 상하이기술대학, UCF-Crime, XD-Violence 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

In this paper, we address the problem of weakly-supervised video anomaly detection, in which given video-level labels for training, we aim to identify in test videos, the snippets containing abnormal events. Although current methods based on multiple instance learning (MIL) show effective detection performance, they ignore important video temporal dependencies. Also, the number of abnormal snippets can vary per anomaly video, which complicates the training process of MIL-based methods because they tend to focus on the most abnormal snippet -- this can cause it to mistakenly select a normal snippet instead of an abnormal snippet, and also to fail to select all abnormal snippets available. We propose a novel method, named Multi-scale Temporal Network trained with top-K Contrastive Multiple Instance Learning (MTN-KMIL), to address the issues above. The main contributions of MTN-KMIL are: 1) a novel synthesis of a pyramid of dilated convolutions and a self-attention mechanism, with the former capturing the multi-scale short-range temporal dependencies between snippets and the latter capturing long-range temporal dependencies; and 2) a novel contrastive MIL learning method that enforces large margins between the top-K normal and abnormal video snippets at the feature representation level and anomaly score level, resulting in accurate anomaly discrimination. Extensive experiments show that our method outperforms several state-of-the-art methods by a large margin on three benchmark data sets (ShanghaiTech, UCF-Crime and XD-Violence). The code is available at this https URL

연구 동기 및 목표

  • 기존의 다중 예측 학습 기반 방법들이 시간적 의존성을 간과하고, 비정상 스니펫의 수가 변동될 경우에 어려움을 겪는 점을 해결하기 위해.
  • 비디오 스니펫 내의 짧은 거리 및 긴 거리의 시간적 의존성을 동시에 모델링하여 이상 탐지 성능을 향상시키기 위해.
  • 특성 수준과 점수 수준에서 상위 K개의 정상 스니펫과 비정상 스니펫 간의 큰 간격을 강제하는 대비 학습 전략을 개발하기 위해.
  • 클래스 불균형과 다양한 이상 지속 시간에 비추어, 모든 비정상 스니펫을 정확히 식별할 수 있도록 하기 위해.

제안 방법

  • 다중 척도 시간 네트워크(MTN)는 다양한 수용 영역을 갖는 확장된 컨볼루션의 피라미드를 사용하여 짧은 거리의 시간적 의존성을 캡처하도록 설계되었다.
  • 자기주의 기반 어텐션 메커니즘이 MTN에 통합되어 먼 거리의 비디오 스니펫 간의 장거리 시간적 의존성을 모델링한다.
  • 상위 K개의 가장 이상적인 스니펫을 정상 스니펫과 비교하기 위해 상위 K개 대비 다중 예측 학습(KMIL) 프레임워크를 제안한다.
  • 정상 및 비정상 스니펫 간의 구분 능력을 향상시키기 위해 특성 표현 수준과 이상 점수 수준에서 큰 간격 제약 조건을 강제한다.
  • 상위 K개의 비정상 스니펫의 특징이 임베딩 공간에서 상위 K개의 정상 스니펫의 특징과 분리되도록 보장하기 위해 대비 손실을 적용한다.
  • 스니펫 수준의 레이블 없이 비디오 수준의 레이블만을 사용하여 엔드 투 엔드로 학습함으로써, 약한 감독 학습이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1짧은 거리와 긴 거리의 시간적 의존성을 동시에 모델링하면 약한 감독 기반 비디오 이상 탐지 성능을 향상시킬 수 있는가?
  • RQ2대비 학습을 다중 예측 학습에 어떻게 적용하여 정상 및 비정상 스니펫을 더 잘 분리할 수 있는가?
  • RQ3특성 수준과 점수 수준에서 큰 간격을 강제하면, 다양한 이상 지속 시간을 가진 비디오에서 이상 식별 능력을 향상시킬 수 있는가?
  • RQ4제안된 MTN-KMIL 방법이 표준 기준 데이터셋에서 기존 최신 기준 방법들을 초월하는가?

주요 결과

  • MTN-KMIL은 상하이기술대학 데이터셋에서 최신 기준 성능을 달성하며, 이전 방법들보다 뚜렷하게 뛰어난 성능을 보였다.
  • UCF-Crime 데이터셋에서 제안된 방법은 기존 최신 기준 접근 방식보다 더 높은 평균 평균 정밀도(mAP)를 달성했다.
  • XD-Violence 데이터셋에서 MTN-KMIL는 다중 또는 장기 지속 이상을 식별하는 데서 뛰어난 탐지 정확도를 보였다.
  • 절단 분석 결과, 다중 척도 시간 모델링과 대비 KMIL 손실 모두 성능 향상에 기여하는 중요한 요소임을 확인했다.
  • 모델은 비정상 스니펫의 수가 변동될 경우에도 안정적이며, 일반적으로 가장 이상적인 스니펫에만 집중하는 문제를 피할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.