Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stream Multi-dimensional Convolutional Network for Real-time Violence Detection

Dipon Kumar Ghosh, Amitabha Chakrabarty|arXiv (Cornell University)|2022. 11. 08.
Anomaly Detection Techniques and Applications인용 수 5
한 줄 요약

이 논문은 실시간 폭력 행위 탐지에 적합한 경량화된 이중 스트림 다차원 합성곱 신경망(2s-MDCN)을 제안한다. 동일한 시공간 위치에서 1D, 2D, 3D 합성곱을 병렬로 적용하여 공간적 및 시간적 특징을 추출함으로써 정보 손실을 감소시키고, RWF-2000 데이터셋에서 89.7%의 최고 성능을 달성한다. 파라미터 수는 0.92M개, 계산 복잡도는 8.97 GFLOPs에 불과하다.

ABSTRACT

The increasing number of surveillance cameras and security concerns have made automatic violent activity detection from surveillance footage an active area for research. Modern deep learning methods have achieved good accuracy in violence detection and proved to be successful because of their applicability in intelligent surveillance systems. However, the models are computationally expensive and large in size because of their inefficient methods for feature extraction. This work presents a novel architecture for violence detection called Two-stream Multi-dimensional Convolutional Network (2s-MDCN), which uses RGB frames and optical flow to detect violence. Our proposed method extracts temporal and spatial information independently by 1D, 2D, and 3D convolutions. Despite combining multi-dimensional convolutional networks, our models are lightweight and efficient due to reduced channel capacity, yet they learn to extract meaningful spatial and temporal information. Additionally, combining RGB frames and optical flow yields 2.2% more accuracy than a single RGB stream. Regardless of having less complexity, our models obtained state-of-the-art accuracy of 89.7% on the largest violence detection benchmark dataset.

연구 동기 및 목표

  • 감시 시스템에서 실시간 폭력 행위 탐지에 사용되는 기존 딥러닝 모델의 비효율성과 높은 계산 비용을 해결하기 위해.
  • 순차적인 처리 방식이 아닌 동시에 공간적 및 시간적 특징을 처리함으로써 시공간 특징 추출 과정에서의 정보 손실을 줄이기 위해.
  • Jetson Nano와 같은 엣지 디바이스에 배포 가능한 경량이면서도 정확한 모델을 개발하기 위해.
  • 모델 복잡도를 크게 증가시키지 않으면서도 RGB 및 옵티컬 플로우 스트림을 융합하여 탐지 정확도를 향상시키기 위해.
  • 미래의 실시간 폭력 행동 탐지 분야 연구를 위한 강력하고 효율적인 기준 모델을 확립하기 위해.

제안 방법

  • RGB 프레임과 옵티컬 플로우를 위한 별도의 브랜치를 갖춘 이중 스트림 아키텍처를 사용하여 공간적 및 운동 정보를 병렬 처리한다.
  • 개별 프레임에서 2D 및 1D 합성곱을 통해 공간적 특징을 추출하고, 연속된 프레임을 통해 3D 합성곱을 적용하여 시간적 동역학을 캡처한다.
  • 1D, 2D, 3D 합성곱 레이어의 융합을 통해 동일한 시공간 위치에서 다중 척도, 다중 차원 특징 학습을 가능하게 한다.
  • 두 스트림의 특징 맵을 연결하여 완전히 연결된 레이어를 거쳐 최종 분류를 수행한다.
  • 채널 용량을 감소시키고 효율적인 아키텍처 설계를 통해 파라미터 수와 계산 비용을 최소화한다.
  • 과적합을 방지하기 위해 조기 정지 기법을 적용한 교차 엔트로피 손실 함수를 사용하여 훈련을 수행하였으며, 훈련/검증 손실 곡선을 통해 이를 관찰할 수 있었다.

실험 결과

연구 질문

  • RQ1순차적 처리 방식에 비해 이중 스트림 다차원 CNN 아키텍처가 실시간 폭력 행위 탐지의 시공간 특징 추출에 있어 성능 향상에 기여하는가?
  • RQ2RGB 및 옵티컬 플로우 입력을 융합함으로써 정확도는 향상시키면서도 계산 복잡도는 낮게 유지할 수 있는가?
  • RQ3경량 모델이 RWF-2000와 같은 대규모 폭력 행위 탐지 벤치마크에서 최고 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4Jetson Nano와 같은 엣지 디바이스에서 제안된 2s-MDCN의 추론 속도 및 배포 가능성은 어떠한가?
  • RQ5기존의 순차적 특징 추출 방식에 비해 공간적 및 시간적 특징을 병렬로 추출함으로써 정보 손실이 감소하는가?

주요 결과

  • 2s-MDCN 모델은 RWF-2000 벤치마크 데이터셋에서 89.7%의 최고 성능을 기록하여, FlowGate(Fusion)를 포함한 기존 모델들을 초월하였다.
  • RGB 및 옵티컬 플로우 스트림의 융합으로 인해 RGB 프레임 단독 사용 대비 정확도가 2.2% 향상되었다.
  • Hockey-fight 데이터셋에서는 100.0%의 정확도, Movies-fight 데이터셋에서는 99.0%의 정확도를 기록하여 다양한 데이터셋에 대한 강력한 일반화 능력을 입증하였다.
  • 0.92M개의 파라미터와 8.97 GFLOPs의 계산 복잡도를 기록하여, 더 높은 정확도를 달성하면서도 FlowGate(16.98 GFLOPs)보다 훨씬 효율적인 성능을 보였다.
  • Jetson Nano 엣지 디바이스에서 RGB 입력만을 사용하여 80 FPS로 영상을 처리했으며, FlowGate(58.18 FPS)보다 37% 이상 빠른 성능을 보였다.
  • 훈련 과정에서 파라미터 수가 적고 안정적인 수렴을 보였으며, 오직 25–35 에포크 동안 경미한 과적합 현상이 관찰되었으나, 훈련이 진행됨에 따라 이를 해결하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.