[논문 리뷰] Multiple Instance-Based Video Anomaly Detection using Deep Temporal Encoding-Decoding
이 논문은 다중 인스턴스 학습을 사용하여 비정상 비디오의 시간적 애너테이션이 부족한 상황에서 약한 감독을 받는 비디오 이상 탐지에 적합한 강력한 시간적 인코딩-디코딩 네트워크를 제안한다. 비디오 클립을 순차적 데이터로 모델링하여 시공간적 진화를 포착한다. 정상 및 비정상 예측 간의 거리를 최대화하는 새로운 손실 함수를 도입하여 UCF-Crime에서 최고 성능을 기록하고 낮은 가짜 경고 비율을 달성하였으며, ShanghaiTech에서도 경쟁력 있는 성능을 보였다.
In this paper, we propose a weakly supervised deep temporal encoding-decoding solution for anomaly detection in surveillance videos using multiple instance learning. The proposed approach uses both abnormal and normal video clips during the training phase which is developed in the multiple instance framework where we treat video as a bag and video clips as instances in the bag. Our main contribution lies in the proposed novel approach to consider temporal relations between video instances. We deal with video instances (clips) as a sequential visual data rather than independent instances. We employ a deep temporal and encoder network that is designed to capture spatial-temporal evolution of video instances over time. We also propose a new loss function that is smoother than similar loss functions recently presented in the computer vision literature, and therefore; enjoys faster convergence and improved tolerance to local minima during the training phase. The proposed temporal encoding-decoding approach with modified loss is benchmarked against the state-of-the-art in simulation studies. The results show that the proposed method performs similar to or better than the state-of-the-art solutions for anomaly detection in video surveillance applications.
연구 동기 및 목표
- 비정상 비디오에 시간적 애너테이션이 부족한 상황에서 약한 감독 비디오 이상 탐지의 과제를 해결하기 위해.
- 기존의 다중 인스턴스 학습 프레임워크를 개선하기 위해 비디오 클립을 독립적인 인스턴스가 아닌 순차적 데이터로 모델링함으로써.
- 정상 예측이 잘못 분류되는 것을 방지하기 위해 더 스무스하고 강력한 손실 함수를 설계하여 감시 응용 프로그램에서의 가짜 경고 비율을 감소시키기 위해.
- 시간적 모델링을 통한 엔드 투 엔드 딥 러닝을 활용하여 UCF-Crime 및 ShanghaiTech와 같은 벤치마크 데이터셋에서 최고 성능을 달성하기 위해.
- 계층적 시공간적 특징 학습을 통해 실제 감시 비디오에서 이상 사건의 효과적인 국소화를 가능하게 하기 위해.
제안 방법
- 모든 비디오를 '백(bag)'으로 간주하고, 개별 클립을 다중 인스턴스 학습 프레임워크 내의 '인스턴스'로 간주하며, 학습 시 정상 및 비정상 비디오를 모두 활용한다.
- 순차적 비디오 클립 간의 저수준, 중간 수준, 고수준의 시공간적 특징을 포착하기 위해 깊이 신경망 기반의 시간적 인코딩-디코딩 네트워크를 사용한다.
- 최대 풀링 기반의 이전 연구와는 달리, 인스턴스 수준의 예측을 평균 풀링을 통해 백 수준의 예측으로 통합하여 더 스무스한 매핑을 보장한다.
- 정상 및 비정상 인스턴스의 예측 임베딩 간 평균 거리를 최대화하는 새로운 손실 함수를 설계하며, 정상 인스턴스가 잘못 분류되어 비정상으로 간주되는 경우에 보상한다.
- 학습 중 손실 함수를 적용하여 정상 및 비정상 예측 간의 명확한 마진을 강제함으로써 가짜 경고를 최소화한다.
- C3D 특징을 사용하여 모델을 엔드 투 엔드로 훈련하고, 제안된 손실 함수를 사용하여 확률적 경사 하강법으로 최적화함으로써, 프레임 수준의 애너테이션이 없이도 약한 감독이 가능하도록 한다.
실험 결과
연구 질문
- RQ1약한 감독 비디오 이상 탐지에서 비디오 클립 간의 시간적 종속성을 효과적으로 모델링할 수 있는가?
- RQ2계층적 시공간 표현을 포착함으로써 깊이 신경망 기반의 시간적 인코딩-디코딩 네트워크가 이상 탐지 성능을 향상시킬 수 있는가?
- RQ3정상 및 비정상 예측 간의 더 큰 마진을 강제함으로써 가짜 경고를 보상하는 수정된 손실 함수가 더 나은 일반화 성능을 이끌 수 있는가?
- RQ4제안된 방법은 벤치마크 데이터셋에서 이상 탐지 정확도 및 가짜 경고 비율 측면에서 최고 성능 기술과 비교해 어떻게 성능을 내는가?
- RQ5약한 감독 하에서 비디오 이상 탐지의 효과적인 시퀀스 모델링을 위해 최적의 시간 컨볼루션 커널 크기는 무엇인가?
주요 결과
- 제안된 방법은 UCF-Crime 데이터셋에서 최고 성능을 기록한 낮은 가짜 경고 비율을 달성하였으며, 기준 방법 및 이전 최고 성능 기술을 크게 앞서갔다.
- ShanghaiTech 데이터셋에서 모델은 AUC 87.42%를 기록하여, Zhong 등 [20]에 비해 11.23% 향상되었고, Zhaeer 등 [53]에 비해 3% 향상되었으며, Zaheer 등 [21]에 비해 약 2.36% 낮게 기록되었다.
- 제거 분석 결과, ED-TCN 네트워크에 제안된 손실 함수를 사용할 경우 AUC 76.56%를 기록한 반면, 제안된 방법은 AUC 79.49%를 달성하여 아키텍처와 손실 함수의 조합이 효과적임을 입증하였다.
- 백 수준 집계에서 최대 풀링을 평균 풀링으로 대체함으로써 더 스무스한 예측 매핑이 가능해졌으며, 이는 가짜 경고 감소에 기여하였다.
- UCF-Crime에서 시간 컨볼루션 커널 크기 4가 가장 높은 AUC 성능(79.49%)을 기록하여 이 설정에서 최적의 시퀀스 모델링 능력을 보였다.
- 제안된 손실 함수는 정상 클립이 높은 이상 점수를 받는 경우를 보상함으로써 가짜 경고를 효과적으로 감소시켰으며, 이는 50% 임계값에서 낮은 가짜 경고 비율로 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.