Skip to main content
QUICK REVIEW

[논문 리뷰] Lightning Fast Video Anomaly Detection via Adversarial Knowledge Distillation

Florinel-Alin Croitoru, Nicolae-Cătălin Ristea|arXiv (Cornell University)|2022. 11. 28.
Anomaly Detection Techniques and Applications참고 문헌 92인용 수 4
한 줄 요약

이 논문은 표준 및 적대적 지식 정련의 새로운 조합을 사용하여 다수의 고정도 객체 수준 교사 모델로부터 지식을 정련하는 초고속 프레임 수준 비디오 이상 탐지 모델을 제안한다. 완전 연결 층을 점포 컨볼루션으로 대체하고 저해상도 이상 지ap을 정교화하기 위해 적대적 판별기를 적용함으로써, 학생 모델은 Avenue, ShanghaiTech, UCSD Ped2 벤치마크에서 최신 기술 수준의 정확도를 유지하면서도 1480 FPS를 달성한다 — 가장 빠른 기준 모델보다 7배 이상 빠르다.

ABSTRACT

We propose a very fast frame-level model for anomaly detection in video, which learns to detect anomalies by distilling knowledge from multiple highly accurate object-level teacher models. To improve the fidelity of our student, we distill the low-resolution anomaly maps of the teachers by jointly applying standard and adversarial distillation, introducing an adversarial discriminator for each teacher to distinguish between target and generated anomaly maps. We conduct experiments on three benchmarks (Avenue, ShanghaiTech, UCSD Ped2), showing that our method is over 7 times faster than the fastest competing method, and between 28 and 62 times faster than object-centric models, while obtaining comparable results to recent methods. Our evaluation also indicates that our model achieves the best trade-off between speed and accuracy, due to its previously unheard-of speed of 1480 FPS. In addition, we carry out a comprehensive ablation study to justify our architectural design choices. Our code is freely available at: https://github.com/ristea/fast-aed.

연구 동기 및 목표

  • 감시 시스템에서 실시간 비디오 이상 탐지에 대한 높은 계산 비용을 해결한다.
  • 사전 학습된 검출기를 기반으로 하는 객체 중심 모델의 비효율성을 해결하여 GPU당 20~50 FPS로 처리 속도를 제한한다.
  • 복잡한 객체 수준 교사 모델의 정확도를 유지하면서도 인fer 속도를 크게 향상시킨 프레임 수준의 학생 모델을 개발한다.
  • 학습된 이상 지도를 교사 모델의 이상 지도와 정렬하기 위해 적대적 판별기를 도입하여 지식 정련의 정밀도를 향상시킨다.
  • 속도와 정확도의 최적 균형을 달성하여 실세계 환경에서의 확장 가능한 구현을 가능하게 한다.

제안 방법

  • 추론 속도 향상과 특징 표현 유지의 목적으로 트랜스포머 아키텍처의 완전 연결 층을 점포 컨볼루션 층으로 대체한다.
  • 다양한 객체 수준 교사 모델(예: YOLOv3 기반 검출기)로부터 저해상도 이상 지도 정련을 통해 학생 모델을 훈련시킨다.
  • 정상 패턴을 전달하기 위해 학생 및 교사 이상 지도 간의 평균 제곱오차(MSE) 손실을 사용하여 표준 정련을 적용한다.
  • 각 교사 모델에 대해 적대적 판별기를 도입하여 실제(교사) 및 생성된(학생) 이상 지도를 구분함으로써 정밀도와 국소화 정확도를 향상시킨다.
  • 두 단계 훈련 프로세스를 사용한다: 첫 번째 단계에서는 중간 프레임을 재구성하여 정상적인 시공간 패턴을 학습하고, 두 번째 단계에서는 이상 지도를 정렬하기 위한 정련 손실을 적용한다.
  • 다양한 객체 수준 검출기로부터의 지식을 집계함으로써 다수의 교사 모델로 프레임워크를 확장하여 정확도와 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1프레임 수준의 학생 모델이 훨씬 더 높은 추론 속도에서 최신 기술 수준의 객체 수준 교사 모델과 유사한 이상 탐지 성능을 달성할 수 있는가?
  • RQ2표준 정련과 적대적 정련을 조합하면 표준 정련만 사용할 때보다 학생이 생성한 이상 지도의 정밀도가 향상되는가?
  • RQ3완전 연결 층을 점포 컨볼루션으로 대체하는 것이 비디오 이상 탐지에서 속도와 정확도 양면에서 얼마나 향상되는가?
  • RQ4다양한 벤치마크에서 기존 방법과 비교해 볼 때, 제안된 방법은 속도-정확도 균형에서 얼마나 우수한가?
  • RQ5객체 검출기가 실패하는 상황(예: 날아다니는 종이 등 알려지지 않은 객체 클래스)에서 학생 모델이 교사 모델보다 더 효과적으로 이상을 탐지할 수 있는가?

주요 결과

  • 제안된 학생 모델은 단일 GPU에서 1480 FPS를 달성하여 가장 빠른 경쟁 모델보다 7배 이상 빠르며, 객체 중심 모델보다 28~62배 빠르다.
  • Avenue, ShanghaiTech, UCSD Ped2 벤치마크에서 학생 모델은 최고 성능의 객체 수준 교사 모델과 5% 이내의 마이크로-AUC 스코어를 기록했으며, UCSD Ped2에서 최고 성능로 98.63% AUC를 달성했다.
  • ShanghaiTech의 테스트 비디오 01_0136에서 가장 좋은 교사(T₁)보다 AUC가 12.3% 높게 기록하여 낮은 복잡도에도 불구하고 뛰어난 일반화 능력을 입증했다.
  • YOLOv3 기반 교사 모델이 클래스 제한으로 실패하는 상황(예: 날아다니는 종이 등 알려지지 않은 또는 드문 객체)에서도 학생 모델이 이상을 성공적으로 탐지했다.
  • 완전 연결 층을 점포 컨볼루션으로 대체함으로써 속도(1480 FPS 대 1267 FPS)와 정확도(85.0% 마이크로-AUC 대 71.8%)가 모두 향상되어 아키텍처적 이점이 확인되었다.
  • 적대적 정련은 학생이 생성한 이상 지도의 매끄러움과 국소화 정확도를 크게 향상시켜 잡음 신호를 줄이고 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.