Skip to main content
QUICK REVIEW

[논문 리뷰] Visual anomaly detection in video by variational autoencoder

Faraz Waseem, Rafael Perez Martinez|arXiv (Cornell University)|2022. 03. 08.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 변동형 자동에코더(VAE) 기반 접근법을 제안하여 비지도 학습 환경에서 영상의 시각적 이상 탐지를 수행한다. 변동형 컨volution 레이어 기반 LSTM 자동에코더를 활용하여 확률적 잠재 표현을 통해 시간적 및 공간적 특징을 학습한다. 제안된 방법은 기준 자동에코더 및 컨볼루션 LSTM 모델 대비 벤치마크 데이터셋에서 더 높은 재구성 정확도와 이상 탐지 성능를 확보하였으며, 정상 영상 패턴을 모델링하는 데 있어 VAE 정규화의 효과를 입증한다.

ABSTRACT

Video anomalies detection is the intersection of anomaly detection and visual intelligence. It has commercial applications in surveillance, security, self-driving cars and crop monitoring. Videos can capture a variety of anomalies. Due to efforts needed to label training data, unsupervised approaches to train anomaly detection models for videos is more practical An autoencoder is a neural network that is trained to recreate its input using latent representation of input also called a bottleneck layer. Variational autoencoder uses distribution (mean and variance) as compared to latent vector as bottleneck layer and can have better regularization effect. In this paper we have demonstrated comparison between performance of convolutional LSTM versus a variation convolutional LSTM autoencoder

연구 동기 및 목표

  • 정상적인 레이블이 풍부하게 제공되지 않는 영상에서 시각적 이상을 탐지하는 과제를 해결하기 위해.
  • 자동에코더의 확률적 잠재 표현을 활용하여 재구성 품질 향상과 이상 탐지 성능 향상을 도모하기 위해.
  • 표준 컨볼루션 LSTM 자동에코더와 변동형 컨볼루션 LSTM 자동에코더의 영상 이상 탐지 성능를 비교하기 위해.
  • 정상 영상 시퀀스를 모델링하는 데 있어 변동형 자동에코더의 정규화 이점을 평가하기 위해.
  • VAE 기반 아키텍처를 활용한 비지도 이상 탐지의 실현 가능성을 입증하기 위해.

제안 방법

  • 모델은 평균과 분산 매개변수를 사용하여 결정론적 블로킹 대신 확률적 잠재 공간을 학습하는 변동형 컨볼루션 LSTM 자동에코더를 활용한다.
  • 에코더는 영상 프레임을 컨볼루션 및 LSTM 레이어의 시퀀스를 거쳐 잠재 표현에 대한 분포를 생성한다.
  • 디코더는 샘플링된 잠재 변수로부터 입력 영상을 재구성하며, 평균 제곱 오차를 사용하여 재구성 오차를 최소화한다.
  • 모델은 재구성 오차와 사전 분포로의 KL 발산을 균형 잡는 변동형 추론 목표를 사용하여 엔드 투 엔드로 훈련된다.
  • 이상은 테스트 프레임의 재구성 오차를 측정하여 탐지되며, 높은 오차는 비정상 행동을 나타낸다.
  • 컨볼루션 및 순환 레이어를 통해 공간적 및 시간적 모델링을 통합하여 영상 시퀀스 내 특징 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1표준 자동에코더에 비해 변동형 자동에코더를 사용할 경우 영상에서 재구성 및 이상 탐지 성능가 어떻게 향상되는가?
  • RQ2시각적 이상 탐지에서 변동형 컨볼루션 LSTM 자동에코더와 표준 컨볼루션 LSTM 자동에코더의 상대적 성능는 어떠한가?
  • RQ3VAE의 확률적 잠재 표현이 정상 영상 시퀀스에 대한 일반화 능력에 얼마나 기여하는가?
  • RQ4레이블이 없는 상태에서 VAE를 사용한 비지도 학습이 다양한 시각적 이상을 효과적으로 탐지할 수 있는가?
  • RQ5모델은 영상 시퀀스의 이상 탐지에서 시간적 동역학과 공간적 맥락을 어떻게 다루는가?

주요 결과

  • 변동형 컨볼루션 LSTM 자동에코더는 표준 자동에코더에 비해 정상 영상 시퀀스에서 더 낮은 재구성 오차를 기록하였다.
  • 모델은 UCSD Pedestrian 및 샤먼젠 데이터셋과 같은 벤치마크 영상 데이터셋에서 이상 탐지 성능가 뛰어났다.
  • 확률적 잠재 표현의 사용이 영상 데이터의 정상적인 변동성에 대한 일반화 능력과 강건성을 향상시켰다.
  • 이상 프레임의 재구성 오차는 정상 패턴과 비교해 유의미하게 높게 나타나, 모델이 이상을 정상 패턴과 구분할 수 있음을 확인하였다.
  • 모든 감독 신호 없이도 AUC 점수 측면에서 베이시스라인 모델을 능가하여 강력한 탐지 능력을 보였다.
  • 아블레이션 연구를 통해 변동형 구성 요소(KL 정규화)가 성능 향상에 기여하였음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.