[논문 리뷰] Video Vision Transformers for Violence Detection
이 논문은 공간-시간 주의 메커니즘과 데이터 증강을 활용하여 제한된 데이터셋에서 성능을 향상시키기 위해 Video Vision Transformer (ViViT) 기반의 엔드 투 엔드 프레임워크를 제안한다. 이는 하키 싸움 데이터셋에서 97.14%의 최고 성능 정확도와 군중 싸움 데이터셋에서 98.46%의 최고 성능 정확도를 기록하여 기존의 CNN 기반 방법에 비해 뛰어난 일반화 능력과 계산 효율성을 입증한다.
Law enforcement and city safety are significantly impacted by detecting violent incidents in surveillance systems. Although modern (smart) cameras are widely available and affordable, such technological solutions are impotent in most instances. Furthermore, personnel monitoring CCTV recordings frequently show a belated reaction, resulting in the potential cause of catastrophe to people and property. Thus automated detection of violence for swift actions is very crucial. The proposed solution uses a novel end-to-end deep learning-based video vision transformer (ViViT) that can proficiently discern fights, hostile movements, and violent events in video sequences. The study presents utilizing a data augmentation strategy to overcome the downside of weaker inductive biasness while training vision transformers on a smaller training datasets. The evaluated results can be subsequently sent to local concerned authority, and the captured video can be analyzed. In comparison to state-of-theart (SOTA) approaches the proposed method achieved auspicious performance on some of the challenging benchmark datasets.
연구 동기 및 목표
- 감시 영상에서 실시간 폭력 탐지를 위한 엔드 투 엔드 딥 러닝 프레임워크를 개발하는 것.
- 영상 비전 트랜스포머에서의 제한된 학습 데이터 문제를 해결하기 위해 효과적인 데이터 증강 전략을 적용하는 것.
- 사람 간 폭력과 군중 갈등을 포함한 다양한 폭력 시나리오에 대한 일반화 능력을 향상시키는 것.
- 기존의 CNN 기반 접근 방식보다 더 높은 정확도와 계산 효율성을 달성하는 것.
- 실시간 영상 분석을 통해 경찰 및 공공 안전 시스템에 신속한 자동 경고를 제공할 수 있도록 하는 것.
제안 방법
- 영상 클립을 공간-시간 패치의 시퀀스로 처리하는 Video Vision Transformer (ViViT) 아키텍처를 사용한다.
- 입력 영상 클립은 크기 (8,8,8)인 3D 패치로 분할되며, 선형 임bedding이 적용되고 위치 인코딩이 추가된다.
- 공간-시간 토큰은 다중 헤드 자기주의 주의를 갖춘 트랜스포머 인코더 레이어 스택에 입력되어 공간과 시간에 걸친 장거리 의존성을 포착한다.
- 작은 데이터셋에서 ViT의 약한 인도크티브 바이어스를 보완하기 위해 데이터 증강 전략을 적용한다.
- 최종 분류 헤드는 [CLS] 토큰 표현에 기반한 학습된 분류기 헤드를 사용하여 이진 예측(폭력 또는 비폭력)을 출력한다.
- 패치 크기, 학습률, 가중치 감쇠, 레이어 수 등의 하이퍼파ram터는 반복적 검증을 통해 성능 최적화를 위해 조정된다.
실험 결과
연구 질문
- RQ1기존의 CNN 기반 모델에 비해 Video Vision Transformer (ViViT) 아키텍처가 폭력 탐지에서 뛰어난 성능을 내는가?
- RQ2작규모 폭력 탐지 데이터셋에서 데이터 증강 전략이 ViT 성능 향상에 얼마나 효과적인가?
- RQ3제안된 모델은 사람 간 폭력과 군중 기반 폭력과 같은 다양한 유형의 폭력 사건에 일반화 가능한가?
- RQ4다중 헤드 자기주의 주의와 패치 기반 처리와 같은 아키텍처 구성 요소가 영상 분류에서 공간-시간 특징 학습에 미치는 영향은 무엇인가?
- RQ5벤치마크 데이터셋에서 기존 최고 성능(SOTA) 방법과 비교해 모델의 정확도와 학습 안정성은 어떻게 되는가?
주요 결과
- 제안된 ViViT 기반 모델은 하키 싸움 데이터셋에서 훈련 정확도 96.57%와 검증 정확도 97.14%를 달성하였다.
- 군중 싸움 데이터셋에서는 훈련 정확도 98.73%와 검증 정확도 98.46%를 기록하여 이전의 최고 성능(SOTA) 방법을 뛰어넘었다.
- 훈련 손실과 검증 손실 간 격차가 미미하고 안정적인 학습 곡선을 보이며 일반화 능력이 뛰어나고 과적합이 심각하지 않음을 시사했다.
- 두 데이터셋 모두에서 정밀도, 재현도, F1 점수 지표가 높게 유지되어 전체 정확도를 넘어서는 견고한 분류기 성능을 입증했다.
- 3D-CNN, CNN+LSTM, 앙상블 모델을 포함한 모든 기존 SOTA 방법보다 두 벤치마크 데이터셋 모두에서 성능이 뛰어났다.
- 아키텍처는 계산 효율성과 확장성을 보이며, 감시 시스템에서 실시간 배포에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.