[논문 리뷰] Dual Memory Units with Uncertainty Regulation for Weakly Supervised Video Anomaly Detection
이 논문은 약한 감독 비디오 이상 탐지(WS-VAD)에서 높은 오류 경고 비율을 줄이기 위해 정상 데이터 패턴을 개선함으로써, 정상 및 비정상 프로토타입을 위한 이중 메모리 백업과 정상 데이터의 불확실성 학습 기반 기법을 활용하는 새로운 불확실성 조절 이중 메모리 유닛(UR-DMU) 모델을 제안한다. 글로벌 및 로컬 다중 헤드 자기주의 모듈과 이중 메모리 분리 손실을 통합함으로써, UCF-Crime 및 XD-Violence에서 최신 기술 수준(SOTA) 성능을 달성하였으며, XD-Violence에서 AUC는 94.02%이고 AP는 82.85%로 기존 방법들을 크게 능가한다.
Learning discriminative features for effectively separating abnormal events from normality is crucial for weakly supervised video anomaly detection (WS-VAD) tasks. Existing approaches, both video and segment-level label oriented, mainly focus on extracting representations for anomaly data while neglecting the implication of normal data. We observe that such a scheme is sub-optimal, i.e., for better distinguishing anomaly one needs to understand what is a normal state, and may yield a higher false alarm rate. To address this issue, we propose an Uncertainty Regulated Dual Memory Units (UR-DMU) model to learn both the representations of normal data and discriminative features of abnormal data. To be specific, inspired by the traditional global and local structure on graph convolutional networks, we introduce a Global and Local Multi-Head Self Attention (GL-MHSA) module for the Transformer network to obtain more expressive embeddings for capturing associations in videos. Then, we use two memory banks, one additional abnormal memory for tackling hard samples, to store and separate abnormal and normal prototypes and maximize the margins between the two representations. Finally, we propose an uncertainty learning scheme to learn the normal data latent space, that is robust to noise from camera switching, object changing, scene transforming, etc. Extensive experiments on XD-Violence and UCF-Crime datasets demonstrate that our method outperforms the state-of-the-art methods by a sizable margin.
연구 동기 및 목표
- 약한 감독 비디오 이상 탐지(WS-VAD)에서 높은 오류 경고 비율 문제를 해결하기 위해 정상 데이터 패턴의 모델링을 향상시키는 것.
- 기존 방법들이 이상 현상에 대한 분류 특징 학습에만 집중하면서 정상 데이터 표현을 간과하는 한계를 극복하는 것.
- 정상 비디오 데이터에서 카메라 전환, 물체 변화, 장면 전환 등의 노이즈에 대한 강건성을 향상시키는 것.
- 정상 및 비정상 프로토타입을 분리하는 데에 효과적인 이중 메모리 백업을 활용한 더 나은 메모리 메커니즘을 개발하는 것.
- 불확실성 모델링을 통해 노이즈에 강건한 잠재 정상 공간을 학습함으로써 이상 탐지 성능을 향상시키는 것.
제안 방법
- 비디오 시퀀스에서 장기적이고 국소적인 시간적 의존성을 더 잘 포착하기 위해 글로벌 및 로컬 다중 헤드 자기주의(GL-MHSA) 모듈을 도입하여 표현력 있는 특징 임베딩을 얻는다.
- 비디오 수준의 레이블을 활용하여 정상 프로토타입용 메모리 백업과 비정상 프로토타입용 메모리 백업을 별도로 운영함으로써 대표적인 특징를 저장하고 분리한다.
- 정상 및 비정상 메모리 표현 간의 마진을 최대화하여 분류 능력을 향상시키기 위해 이중 메모리 분리 손실을 설계한다.
- 정상 특징를 학습 가능한 평균과 분산을 가진 가우시안 분포로 모델링하는 정상 데이터 불확실성 학습(NUL) 기법을 제안하여 노이즈에 대한 강건성을 향상시킨다.
- 특징 크기를 기반으로 한 전략을 활용해 양성 인스턴스 선택을 이끌며, 이상 탐지에서 효과적인 전략으로 평가된 RTFM의 전략과 일치시킨다.
- GL-MHSA, 이중 메모리 유닛, NUL을 통합된 프레임워크 내에서 함께 최적화함으로써 특징 학습, 메모리 표현, 불확실성 모델링을 동시에 향상시킨다.

실험 결과
연구 질문
- RQ1정상 데이터의 잠재적 구조를 모델링하면 약한 감독 비디오 이상 탐지에서 이상 탐지 성능을 향상시키고 오류 경고를 줄일 수 있는가?
- RQ2정상 및 비정상 프로토타입을 위한 이중 메모리 백업을 사용할 경우 단일 메모리 백업보다 정상 및 비정상 패턴 간 분리가 더 잘 이루어지는가?
- RQ3정상 특징의 불확실성 모델링이 카메라 전환, 물체 변화, 장면 전환 등의 노이즈에 대해 강건성을 향상시킬 수 있는가?
- RQ4GL-MHSA 모듈은 이상 비디오 표현을 위해 글로벌 및 로컬 시간적 의존성을 효과적으로 포착하는가?
- RQ5각 손실 구성 요소(트리플렛, 이중 메모리, KL, 분리)가 전체 탐지 성능에 기여하는 정도는 어떠한가?
주요 결과
- 전체 UR-DMU 모델은 XD-Violence 데이터셋에서 AUC 94.02%와 AP 82.85%를 달성하여 최신 기술 수준의 방법들을 능가한다.
- UCF-Crime에서 모델은 AUC 86.97%와 AP 37.25%를 기록하여 다양한 데이터셋에서 뛰어난 성능을 보였다.
- 제거 실험 결과, DMU 모듈을 추가함으로써 AUC와 AP가 향상되고 오류 경고 비율(FAR)이 4.86%에서 1.05%로 감소함을 확인하였다.
- NUL 모듈만을 적용해도 AUC는 2.37%p, AP는 2.20%p 향상되어 정상 공간 정규화에서의 효과를 입증하였다.
- GL-MHSA 모듈은 특징 표현에 있어 중요한 기여를 하였으며, 모든 제거 실험 설정에서 전체 모델이 가장 높은 성능를 기록하였다.
- 정성적 결과에서는 제안된 방법이 특히 부드러운 전환을 보이는 복잡한 장면에서 RTFM보다 더 정밀한 이상 지역화와 낮은 오류 경고 비율을 제공하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.