Skip to main content
QUICK REVIEW

[논문 리뷰] An Overview of Violence Detection Techniques: Current Challenges and Future Directions

Nadia Mumtaz, Naveed Ejaz|arXiv (Cornell University)|2022. 09. 21.
Anomaly Detection Techniques and Applications인용 수 6
한 줄 요약

이 논문은 영상 감시에서 폭력 탐지(VD) 기법에 대한 종합적인 서베이를 제공하며, 수작업 특징 기반 전통적 방법과 2D/3D 컨볼루션 네트워크, 트랜스포머, 하이브리드 모델을 포함한 현대 딥 러닝 접근법을 검토한다. 데이터 부족, 계산 비용, 실세계 환경에서의 강인성 등의 과제를 부각시키며, 실시간 실용적 VD 시스템을 위한 엣지 호환 모델, 강화 학습, 설명 가능 AI 등의 향후 방향을 제안한다.

ABSTRACT

The Big Video Data generated in today's smart cities has raised concerns from its purposeful usage perspective, where surveillance cameras, among many others are the most prominent resources to contribute to the huge volumes of data, making its automated analysis a difficult task in terms of computation and preciseness. Violence Detection (VD), broadly plunging under Action and Activity recognition domain, is used to analyze Big Video data for anomalous actions incurred due to humans. The VD literature is traditionally based on manually engineered features, though advancements to deep learning based standalone models are developed for real-time VD analysis. This paper focuses on overview of deep sequence learning approaches along with localization strategies of the detected violence. This overview also dives into the initial image processing and machine learning-based VD literature and their possible advantages such as efficiency against the current complex models. Furthermore,the datasets are discussed, to provide an analysis of the current models, explaining their pros and cons with future directions in VD domain derived from an in-depth analysis of the previous methods.

연구 동기 및 목표

  • 전통적인 영상 처리 기법에서 현대 딥 러닝 기반 접근법에 이르기까지 폭력 탐지(VD) 기법에 대한 체계적인 서베이를 제공하기.
  • 현재 VD 모델의 한계를 분석하기, 특히 높은 계산 비용, 데이터 부족, 비정적 실세계 환경에서의 낮은 일반화 능력.
  • 폭력 행동의 효과적인 국소화, 환경적 간섭에 대한 강인성, 엣지 디바이스에서의 실시간 성능 등의 핵심 과제 식별하기.
  • 향후 잠재적 방향성인 강화 학습, 비전 트랜스포머, 설명 가능 AI 등을 탐색하여 VD 시스템의 신뢰성과 해석 가능성 향상하기.

제안 방법

  • 세 세대에 걸친 VD 기법을 서베이하고 분류하기: 전통적 특징 기반(예: HOG, 운동 벡터), 딥 러닝 기반(2D/3D CNN), 시퀀스 모델링(예: RNN, 트랜스포머).
  • UCF-Crime, HMDB51, UCSD Pedestrian 등의 벤치마크 데이터셋을 사용하여 성능 평가하기, 정확도, 추론 속도, 국소화 능력에 중점을 두기.
  • 3D 컨볼루션과 TimeSformer에서의 어텐션 메커니즘을 통한 시간적 모델링을 포함한 엔드 투 엔드 영상 분류 모델 아키텍처 분석하기.
  • 임베디드 시스템을 위한 모델 복잡도, 추론 지연, 양자화 가능성을 평가하여 엣지 배포 가능성 분석하기.
  • 낮은 데이터 환경에서 효율성과 강인성을 향상시키기 위해 수작업 특징과 딥 러닝을 융합한 하이브리드 모델 제안하기.
  • 영상 이해를 위한 비전 트랜스포머 및 동적 환경에서의 적응형 이상 탐지에 적합한 강화 학습과 같은 새로운 기법 탐색하기.
Figure 3 : The overall structure of the proposed survey.
Figure 3 : The overall structure of the proposed survey.

실험 결과

연구 질문

  • RQ1스마트 시티 감시 환경에서 실시간 폭력 탐지 시스템을 구현하는 데 있어 핵심적인 기술적 및 계산 과제는 무엇인가?
  • RQ2정확도, 강인성, 배포 가능성을 고려할 때 전통적 특징 기반 방법과 딥 러닝 기반 모델 간의 성능 비교는 어떻게 이루어지는가?
  • RQ3갑작스러운 시점 변화나 가림 현상이 발생하는 비정적 환경에서 현재 VD 모델의 한계는 무엇인가?
  • RQ4엣지 컴퓨팅과 경량 모델은 실세계 감시 환경에서의 VD 시스템 실용성에 어떻게 기여할 수 있는가?
  • RQ5비전 트랜스포머, 강화 학습, 설명 가능 AI와 같은 신기술은 향후 VD 시스템의 성능과 신뢰성 향상에 어떻게 기여할 수 있는가?

주요 결과

  • HOG 및 운동 벡터와 같은 수작업 특징에 의존하는 전통적 VD 방법은 계산 비용이 낮지만, 복잡한 운동 패tern과 환경 변화에 대해 강인성이 떨어진다.
  • 2D 및 3D CNN 기반 모델은 표준 데이터셋에서 높은 정확도를 달성하지만, 실세계의 동적 환경에서는 높은 계산 비용과 낮은 일반화 능력 문제를 겪는다.
  • TimeSformer와 같은 비전 트랜스포머는 영상 행동 인식 작업에서 뛰어난 성능을 보이며, VD에서 향상된 시간적 모델링 잠재력을 보여준다.
  • 현재 모델들은 폭력 행동의 국소화를 효과적으로 수행하지 못하는 경우가 많아, 동시 탐지 및 국소화 프레임워크의 필요성이 강력히 제기된다.
  • 메인스트림 딥 러닝 모델의 높은 추론 비용으로 인해 엣지 배포가 여전히 주요 과제로 남아 있으며, 이에 따라 경량화 및 양자화된 아키텍처의 필요성이 대두된다.
  • 강화 학습과 설명 가능 AI와 같은 향후 방향성은 아직 활용이 부족하지만, 실세계 VD 시스템의 적응성과 해석 가능성 향상에 잠재력이 있다.
Figure 5 : The overall process of research articles retrieval from different databases.
Figure 5 : The overall process of research articles retrieval from different databases.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.