Skip to main content
QUICK REVIEW

[논문 리뷰] Self-trained Deep Ordinal Regression for End-to-End Video Anomaly Detection

Guansong Pang, Yan Cheng|arXiv (Cornell University)|2020. 03. 15.
Anomaly Detection Techniques and Applications참고 문헌 41인용 수 22
한 줄 요약

이 논문은 수동으로 레이블링된 정상 데이터에 의존하지 않고, 동시에 표현 학습과 이상 탐지 점수 산정을 가능하게 하는 엔드 투 엔드 비디오 이상 탐지용 자기학습 딥 오더링 회귀 프레임워크를 제안한다. 반복적인 자기학습을 통해 이상 탐지를 서브티튜드 두 클래스 오더링 회귀 문제로 재정의함으로써, 여덟 개인 실세계 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성하며, 이상 지역의 정확한 국소화와 인간이 개입하는 환경에서의 적응성도 확보한다.

ABSTRACT

Video anomaly detection is of critical practical importance to a variety of real applications because it allows human attention to be focused on events that are likely to be of interest, in spite of an otherwise overwhelming volume of video. We show that applying self-trained deep ordinal regression to video anomaly detection overcomes two key limitations of existing methods, namely, 1) being highly dependent on manually labeled normal training data; and 2) sub-optimal feature learning. By formulating a surrogate two-class ordinal regression task we devise an end-to-end trainable video anomaly detection approach that enables joint representation learning and anomaly scoring without manually labeled normal/abnormal data. Experiments on eight real-world video scenes show that our proposed method outperforms state-of-the-art methods that require no labeled training data by a substantial margin, and enables easy and accurate localization of the identified anomalies. Furthermore, we demonstrate that our method offers effective human-in-the-loop anomaly detection which can be critical in applications where anomalies are rare and the false-negative cost is high.

연구 동기 및 목표

  • 기존의 비디오 이상 탐지 방법이 대량의 수동으로 레이블링된 정상 학습 데이터를 필요로 하는 한계를 해결하기 위해.
  • 두 단계 접근법에서의 최적화되지 않은 특징 학습 문제를 극복하기 위해 특징 학습과 이상 점수 산정을 동시에 최적화할 수 있도록 하기 위해.
  • 자기학습을 통한 가짜 레이블을 활용한 약한 지도 학습을 지원하는 엔드 투 엔드 학습 가능한 프레임워크를 개발하기 위해.
  • 높은 위험도의 응용 분야에서 낮은 거짓-음성 비율을 요구하는 상황에서 효과적인 인간-입력 기반 이상 탐지 기능을 제공하기 위해.
  • 클래스 활성화 맵(CAM) 기법을 사용하여 이상 영역을 정확하게 시공간적으로 국소화하기 위해.

제안 방법

  • 엔드 투 엔드 학습을 가능하게 하기 위해 비디오 이상 탐지를 서브티튜드 두 클래스 오더링 회귀 문제로 재정의하기 위해.
  • 예측된 백본(예: ResNet-50)과 일반적인 비지도 이상 탐지기로부터 생성된 가짜 레이블을 사용하여 모델을 초기화하기 위해.
  • 여러 에포크에 걸쳐 반복적인 자기학습을 적용하여 가짜 레이블을 정교화하고 이상 점수 예측 성능을 향상시키기 위해.
  • 특징 추출기(CNN 기반)와 완전 연결된 이상 점수 헤드를 통합하여 동시에 최적화할 수 있도록 하기 위해.
  • 초기 가짜 레이블이 iForest 및 Sp+와 같은 비지도 기반 기준 모델로부터 생성되는 약한 지도 학습 프레임워크를 적용하기 위해.
  • 정확한 이상 국소화를 위해 클래스 활성화 맵(CAM)을 활용하여 시각화 지도를 생성하기 위해.

실험 결과

연구 질문

  • RQ1자기학습 딥 오더링 회귀는 레이블이 없는 정상 데이터가 전혀 필요 없이 기존 최신 기술 수준의 비지도 비디오 이상 탐지 방법을 초월할 수 있는가?
  • RQ2특징 학습과 이상 점수 산정을 동시에 최적화하는 엔드 투 엔드 학습이 두 단계 접근법보다 더 뛰어난 탐지 성능을 달성하는가?
  • RQ3다양한 비디오 데이터셋(이상 비율이 상이함)에서 반복적인 자기학습이 탐지 성능 향상에 얼마나 기여하는가?
  • RQ4모델이 전문가 피드백을 쉽게 통합할 수 있도록 함으로써 효과적인 인간-입력 기반 이상 탐지 기능을 지원할 수 있는가?
  • RQ5기존 기준 모델 대비 모델의 이상 영역 국소화 성능는 어떠한가? 다양한 비디오 도메인 간에서 일반화 가능한가?

주요 결과

  • 제안된 방법은 여덟 개의 실세계 비디오 데이터셋에서 최신 기술 수준의 성능을 달성하며, 레이블이 전혀 필요 없는 기존 비지도 방법들보다 뚜렷하게 뛰어난 성능을 보였다.
  • UMN 데이터셋에서 AUC가 97.4%를 기록하여 다양한 이상 유형과 비디오 환경 간의 강력한 일반화 능력을 입증하였다.
  • 자기학습은 모든 데이터셋에서 AUC 성능 향상을 이끌었으며, 특히 첫 번째 몇 차례 반복에서 가장 큰 향상이 관찰되었고, 4~5회 반복 후 안정화되었다.
  • 동일한 특징 입력을 사용하더라도 두 단계 기반 모델인 Del Giorno 등 [8] #2를 항상 초월하여, 엔드 투 엔드 최적화의 우수성을 입증하였다.
  • CAM 기반 시각화 지도를 통해 정확한 이상 국소화가 가능했으며, 보행자 구역을 횡단하는 차량이나 모든 방향으로 달리는 사람과 같은 이상 영역을 성공적으로 강조하였다.
  • 백본 아키텍처의 변경에도 불구하고 모델은 VGG, 3DConv, ResNet-50 모두에서 뛰어난 성능을 보였으며, 다양한 네트워크 설계 간의 일반화 능력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.