[논문 리뷰] CCTV-Gun: Benchmarking Handgun Detection in CCTV Images
이 논문은 실제 감시카메라 영상에서 권총 탐지를 위한 벤치마크인 CCTV-Gun을 소개한다. 이 벤치마크는 세 가지 데이터셋(MGD, USRT, UCF)에서 권총과 그 소지자에 대한 세밀한 애너테이션을 포함하며, 교차 데이터셋 평가 프로토콜을 제안한다. 최신 기술 기반 탐지기들을 평가한 결과, COCO 사전학습 모델을 미세조정한 모델이 UCF와 같은 저해상도, 부분적으로 가림을 받는 어려운 데이터셋에서 도메인 특화 사전학습보다 성능이 뛰어나다는 것이 확인되었다.
Gun violence is a critical security problem, and it is imperative for the computer vision community to develop effective gun detection algorithms for real-world scenarios, particularly in Closed Circuit Television (CCTV) surveillance data. Despite significant progress in visual object detection, detecting guns in real-world CCTV images remains a challenging and under-explored task. Firearms, especially handguns, are typically very small in size, non-salient in appearance, and often severely occluded or indistinguishable from other small objects. Additionally, the lack of principled benchmarks and difficulty collecting relevant datasets further hinder algorithmic development. In this paper, we present a meticulously crafted and annotated benchmark, called extbf{CCTV-Gun}, which addresses the challenges of detecting handguns in real-world CCTV images. Our contribution is three-fold. Firstly, we carefully select and analyze real-world CCTV images from three datasets, manually annotate handguns and their holders, and assign each image with relevant challenge factors such as blur and occlusion. Secondly, we propose a new cross-dataset evaluation protocol in addition to the standard intra-dataset protocol, which is vital for gun detection in practical settings. Finally, we comprehensively evaluate both classical and state-of-the-art object detection algorithms, providing an in-depth analysis of their generalizing abilities. The benchmark will facilitate further research and development on this topic and ultimately enhance security. Code, annotations, and trained models are available at https://github.com/srikarym/CCTV-Gun.
연구 동기 및 목표
- 실제 감시카메라 영상에서 권총이 작고, 가림을 받으며, 저해상도인 상황에서 원칙적인 벤치마크가 부족한 문제를 해결한다.
- 세 가지 실제 데이터셋에서 권총, 소지자, 도전 과제 요소(예: 흐림, 가림 등)에 대한 세분화된 애너테이션을 포함하는 종합적인 벤치마크를 개발한다.
- 표준 내부 데이터셋 테스트를 넘어서 모델 일반화 능력을 평가하기 위해 새로운 교차 데이터셋 평가 프로토콜을 제안한다.
- 실제 도전 과제 상황에서의 강건성과 성능을 분석하기 위해 전통적 및 최신 기술 기반 객체 탐지기를 벤치마크에서 평가한다.
- 재현 가능성을 보장하고 공공 안전을 위한 권총 탐지 분야의 연구를 가속화하기 위해 코드, 애너테이션, 학습된 모델을 제공한다.
제안 방법
- MGD(재현된 장면), USRT(실시간 권총 탐지), UCF(범죄 장면이 포함된 행동 인식)와 같은 세 가지 데이터셋으로부터 실제 감시카메라 영상을 수집하고 분석하였다.
- 사람, 권총, 권총 소지자 쌍에 대한 수작업으로 바운딩 박스를 애너테이션하였으며, 가림, 흐림, 유사 물체와 같은 도전 과제 요소에 대한 추가 레이블도 포함하였다.
- 이중 평가 프로토콜을 설계하였다: 내부 데이터셋(표준 훈련/검증/테스트 분할)과 교차 데이터셋(두 데이터셋으로 훈련, 나머지 하나로 테스트)을 통해 일반화 능력을 평가하였다.
- COCO 사전학습 모델과 MGD+USRT와 같은 권총 전용 데이터셋으로 사전학습한 모델을 미세조정하여, 도메인 특화 사전학습이 미지의 데이터셋에서 성능 향상에 기여하는지 평가하였다.
- 표준 및 교차 데이터셋 설정에서 여러 최신 기술 기반 객체 탐지기(YOLOv5, RetinaNet, Swin-T, ConvNeXt-T)를 평가하였다.
- 테스트 분할에 대해 세 가지 도전 요소(가림, 흐림, 유사 물체)를 애너테이션하여, 특정 시각적 열화 조건에서의 모델 강건성 분석을 수행하였다.
실험 결과
연구 질문
- RQ1최신 기술 기반 객체 탐지기는 실제 감시카메라 영상에서 작은, 가림을 받고, 저해상도인 권총에 대해 어떻게 성능을 발휘하는가?
- RQ2교차 데이터셋 평가가 표준 내부 데이터셋 평가와 비교해 모델 일반화 능력에 있어 뚜렷한 차이를 드러내는가?
- RQ3MGD+USRT와 같은 권총 전용 데이터셋으로 사전학습한 모델이 UCF와 같은 다양한 실제 데이터셋에서 COCO 사전학습 모델을 초월할 수 있는가?
- RQ4가림, 흐림, 유사 물체와 같은 특정 도전 요소들이 다양한 모델의 탐지 성능에 어떻게 영향을 미치는가?
- RQ5어느 모델 아키텍처가 실제 시각적 열화 조건과 작은 물체 조건에서 가장 강건한 성능을 보이는가?
주요 결과
- MGD+USRT로 훈련한 모델는 교차 데이터셋 평가에서 UCF에서 성능이 열악하여, 저해상도, 실제 범죄 장면 영상으로의 일반화 능력이 제한됨을 시사한다.
- USRT+UCF로 훈련한 모델는 MGD에서 높은 성능을 기록하여, 선명하고 고해상도 영상은 더 단순한 탐지 작업으로의 전이 학습을 더 잘 가능하게 한다는 것을 시사한다.
- COCO 사전학습 모델을 미세조정한 모델이 UCF에서 도메인 특화 사전학습보다 뛰어난 성능을 보였으며, 특히 타겟 데이터셋에서 높은 가림과 저해상도가 특징일 경우 더욱 두드러졌다.
- ConvNeXt-T는 가림, 흐림, 유사 물체의 4개 중 6개 도전 카테고리에서 평균 정밀도가 가장 높아, 뛰어난 강건성을 보였다.
- 모델 간 성능 격차는 UCF에서 가장 두드러졌으며, 저해상도와 심한 가림이 탐지 정확도를 크게 떨어뜨렸다.
- 도전 요소별 평가 결과, 내부 데이터셋에서 높은 AP 점수를 기록한 모델은 일관되게 가림, 흐림, 유사 물체에 대한 강건성이 높았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.