[논문 리뷰] Exploring Diffusion Models for Unsupervised Video Anomaly Detection
이 논문은 레이블이 없는 데이터를 사용하여 재구성 오차를 기반으로 이상을 식별하는 확산 모델을 활용한 새로운 비지도 비디오 이상 탐지 방법을 제안한다. 최적화된 노이즈 스케줄링과 임계값 설정을 적용한 k-확산 모델을 통해 UCF-Crime 및 상하이기술대 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 일부 경우에서 이전의 생성 모델 및 더 복잡한 아키텍처를 능가한다.
This paper investigates the performance of diffusion models for video anomaly detection (VAD) within the most challenging but also the most operational scenario in which the data annotations are not used. As being sparse, diverse, contextual, and often ambiguous, detecting abnormal events precisely is a very ambitious task. To this end, we rely only on the information-rich spatio-temporal data, and the reconstruction power of the diffusion models such that a high reconstruction error is utilized to decide the abnormality. Experiments performed on two large-scale video anomaly detection datasets demonstrate the consistent improvement of the proposed method over the state-of-the-art generative models while in some cases our method achieves better scores than the more complex models. This is the first study using a diffusion model and examining its parameters' influence to present guidance for VAD in surveillance scenarios.
연구 동기 및 목표
- 감시 환경에서 비지도 비디오 이상 탐지(VAD)에 대해 확산 모델의 타당성과 효과성을 조사한다.
- 노이즈 스케줄링과 임계값 설정과 같은 핵심 확산 모델 하이퍼파라미터가 이상 탐지 성능에 미치는 영향을 탐색한다.
- 이상 레이블이 제공되지 않는 실세계 환경에서도 확산 모델을 구현하는 데 실용적인 지침을 제공한다.
- 확산 모델에서 높은 재구성 오차가 이상 비디오 프레임을 신뢰성 있게 나타낼 수 있음을 보여준다.
제안 방법
- 모델은 레이블이 없는 비디오 클립에서 시공간적 특징을 재구성하기 위해 노이즈 제거 확산 모델을 사용하며, 재구성 오차를 이상도 수치로 활용한다.
- k-확산 공식을 적용하여 역과정이 사용자가 정의한 타임스텝 $ t $에서 시작되도록 하여 노이즈 수준과 정보 유지 정도를 제어한다.
- 푸리에 특징과 FiLM 레이어를 통해 타임스텝 임bedding을 도입하여 노이즈 수준에 따라 노이즈 제거 과정을 조절한다.
- 데이터 기반 임계값을 사용하여 이상을 탐지한다: $ L_{th} = \mu_p + k\sigma_p $, 여기서 $ \mu_p $ 와 $ \sigma_p $ 는 배치 내 MSE 손실의 평균과 표준편차이다.
- 모델은 이상 레이블에 접근할 수 없도록 정상 비디오 클립만으로 훈련된다.
- 모델은 두 개의 대규모 벤치마크인 UCF-Crime 및 상하이기술대에서 AUC 점수를 사용하여 평가된다.

실험 결과
연구 질문
- RQ1레이블이 전혀 없는 조건에서 확산 모델이 비디오 이상을 효과적으로 탐지할 수 있는가?
- RQ2역노이즈 과정의 시작 타임스텝 $ t $ 가 재구성 오차와 이상 탐지 성능에 미치는 영향은 어떠한가?
- RQ3데이터 기반 임계값 $ L_{th} = \mu_p + k\sigma_p $ 에서 임계값 승수 $ k $ 의 최적 값은 무엇인가?
- RQ4다양한 백본 아키텍처(예: 3D-ResNet18, 3D-ResNeXt101)가 VAD에서 확산 모델 하이퍼파라미터와 어떻게 상호작용하는가?
- RQ5제안된 방법은 기존 최신 기술 수준의 생성 모델보다 비지도 VAD에서 더 잘 일반화되는가?
주요 결과
- 제안된 방법은 UCF-Crime 및 상하이기술대 데이터셋 모두에서 최신 기술 수준 성능을 달성하였으며, 오토에코더 기반 이전의 SOTA 생성 모델을 능가한다.
- 상하이기술대에서 3D-ResNet18을 사용할 경우 최적의 성능은 $ t=6 $ 에서 달성되었고, 다른 설정에서는 $ t=4 $ 가 최적임을 확인하여 노이즈 스케줄링에 민감함을 확인하였다.
- 임계값 승수 $ k $ 는 성능에 큰 영향을 미친다: 3D-ResNeXt101의 경우 두 데이터셋 모두에서 $ k=0.5 $ 가 최고 성능을 냈고, 3D-ResNet18의 경우 상하이기술대에서는 $ k=0.7 $, UCF-Crime에서는 $ k=0.1 $ 이 최적임을 확인하였다.
- 최고의 $ k $ 값과 최악의 $ k $ 값 간의 AUC 차이는 최대 3%p에 이르며, 하이퍼파라미터 튜닝의 중요성을 강조한다.
- 복잡한 모델(예: 공동 생성-판별 학습 기반 모델)을 포함한 일부 설정에서조차도 제안된 방법이 뛰어난 성능을 보이며, 확산 모델 기반 재구성 기반 이상 탐지의 강력함을 입증한다.
- 정성적 결과는 실제 이상 발생 시점에서 이상 점수의 급격한 상승과 이후 감소를 보여주며, 시간적 일치성과 민감도를 확인한다.
![Fig. 2 : The effect of noise and the starting point of the reverse process while performing k-diffusion for VAD. The results (AUC %) belong to ShanghaiTech dataset [ 3 ] with 3D-ResNet18 backbone.](https://ar5iv.labs.arxiv.org/html/2304.05841/assets/noise.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.