Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP-TSA: CLIP-Assisted Temporal Self-Attention for Weakly-Supervised Video Anomaly Detection

Hyekang Kevin Joo, Khoa Vo|arXiv (Cornell University)|2022. 12. 09.
Anomaly Detection Techniques and Applications인용 수 7
한 줄 요약

이 논문은 CLIP-Encoded 시각적 특징과 시간적 자기주의(TSA) 메커니즘을 활용하여 이상 탐지 정밀도를 향상시키는 새로운 약한 감독형 비디오 이상 탐지 프레임워크인 CLIP-TSA를 제안한다. 기존의 C3D/I3D 백본 대신 CLIP 특징을 사용하고, 이방법으로 이상 스피크트를 강조하는 미분 가능한 top-κ 주의를 적용함으로써, UCF-Crime, ShanghaiTech Campus, XD-Violence에서 최신 기술(SOTA) 성능을 달성하며 기존 방법들보다 뚜렷한 성능 향상을 보였다.

ABSTRACT

Video anomaly detection (VAD) -- commonly formulated as a multiple-instance learning problem in a weakly-supervised manner due to its labor-intensive nature -- is a challenging problem in video surveillance where the frames of anomaly need to be localized in an untrimmed video. In this paper, we first propose to utilize the ViT-encoded visual features from CLIP, in contrast with the conventional C3D or I3D features in the domain, to efficiently extract discriminative representations in the novel technique. We then model temporal dependencies and nominate the snippets of interest by leveraging our proposed Temporal Self-Attention (TSA). The ablation study confirms the effectiveness of TSA and ViT feature. The extensive experiments show that our proposed CLIP-TSA outperforms the existing state-of-the-art (SOTA) methods by a large margin on three commonly-used benchmark datasets in the VAD problem (UCF-Crime, ShanghaiTech Campus, and XD-Violence). Our source code is available at https://github.com/joos2010kj/CLIP-TSA.

연구 동기 및 목표

  • 비디오 수준의 레이블만 제공되는 약한 감독형 비디오 이상 탐지(VAD) 문제에 도전하여 레이블링 부담을 줄이기.
  • 행동 인식에서 미리 훈련된 전통적 백본(C3D, I3D 등)이 이상 탐지에서 도메인 갭 문제로 인해 성능에 한계를 가짐을 극복하기.
  • 시간적 일관성을 모델링하고 두드러진 이상 패턴을 식별하여, 정규화되지 않은 비디오에서 이상 스피크트의 국소화를 향상시키기.
  • MIL 설정 하에서 미분 가능한 top-κ 주의 메커니즘을 개발하여 가장 이상적인 스피크트를 효과적으로 선택하기.
  • CLIP의 시각-언어 특징과 새로운 시간적 주의 메커니즘의 조합이 이상 탐지에 효과적인지 입증하기.

제안 방법

  • CLIP의 ViT 기반 시각 인코더를 사용하여 각 스피크트의 중간 프레임에서 풍부하고 구분력 있는 특징을 추출하고, 기존의 행동 인식 백본을 대체한다.
  • 각 비디오를 고정 길이(δ=16)의 스피크트로 나누고, CLIP를 사용해 각 스피크트를 512차원 특징 벡터로 표현하여, 비디오당 T=32개의 스피크트 시퀀스를 형성한다.
  • 이상성 점수에 기반해 스피크트 특징을 재가중하는 데 목적이 있는 시간적 자기주의(TSA)를 도입하여 이상 스피크트에 대한 주의를 강화하고 정상 스피크트는 억제한다.
  • MIL 설정 하에서 엔드 투 엔드 훈련이 가능한 하드 주의를 사용해, 미분 가능한 top-κ 함수를 적용하여 κ=0.7×T에 해당하는 가장 이상적인 스피크트를 선택한다.
  • 양성(이상) 비디오에 대해 더 높은 주의를 유도하고, 음성(정상) 비디오에 대해 더 낮은 주의를 유도하는 차이 최대화 트레이너를 사용해 모델을 훈련시킨다.
  • MLP 스코어 네트워크를 사용해 이상도 점수를 예측하고, Adam 옵timizer를 사용해 전체 모델을 엔드 투 엔드로 최적화하며, 학습률 0.001, 배치 크기 16을 사용한다.

실험 결과

연구 질문

  • RQ1C3D나 I3D와 같은 행동 인식 기반 백본에 비해 CLIP-에코딩된 시각적 특징이 비디오 이상 탐지의 표현 학습에 유의미한 향상을 이끌 수 있는가?
  • RQ2비디오 수준의 레이블만 제공되는 약한 감독 하에서 제안된 시간적 자기주의(TSA) 메커니즘이 이상 스피크트의 국소화에 효과적인가?
  • RQ3CLIP 특징과 TSA의 조합이 표준 VAD 벤치마크에서 최신 기술 방법들과 비교해 어떻게 성능을 냅니다?
  • RQ4미분 가능한 top-κ 주의 메커니즘이 약한 감독 이상 탐지에서 모델 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 방법은 다양한 이상 유형과 시간 패턴을 가진 다양한 데이터셋에 일반화 가능한가?

주요 결과

  • UCF-Crime에서 CLIP-TSA는 AUC@ROC 87.58%를 기록하여 이전 SOTA보다 3.5% 포인트 높은 성능을 달성했다.
  • ShanghaiTech Campus에서 CLIP-TSA는 98.32% AUC@ROC를 기록하여 런업 메서드보다 1.11% 향상되었고, 이전 SOTA 방법보다는 12.89% 향상되었다.
  • XD-Violence에서 CLIP-TSA는 82.19% AUC@PR을 기록하여 모든 시각 기반 베이스라인을 크게 능가했으며, 다중 모odal SOTA 방법과도 맞추거나 초월했다.
  • 제거 실험 결과, CLIP 특징과 TSA 모두 성능 향상에 기여하는 것으로 확인되었으며, TSA를 제거하면 UCF-Crime에서 최대 1.5% 감소하고, ShanghaiTech에서는 1.2% 감소했다.
  • CLIP를 C3D나 I3D로 교체하면 UCF-Crime와 ShanghaiTech에서 성능이 3.5–4.5% 포인트 감소하여 CLIP 특징의 우수성을 입증했다.
  • 미분 가능한 top-κ 함수는 가장 이상적인 스피크트를 효과적으로 식별하며, 복잡한 시나리오에서도 모델이 항상 이상 영역에 주의를 기울이는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.