Skip to main content
QUICK REVIEW

[論文レビュー] CCTV-Gun: Benchmarking Handgun Detection in CCTV Images

Srikar Yellapragada, Zhenghong Li|arXiv (Cornell University)|Mar 19, 2023
Advanced Optical Sensing Technologies被引用数 4
ひとこと要約

本稿では、実世界のCCTV画像における銃器検出のためのベンチマーク「CCTV-Gun」を紹介する。本ベンチマークは、3つのデータセット(MGD、USRT、UCF)にまたがる銃器およびその保持者の詳細なアノテーションを備え、クロスデータセット評価プロトコルを提案。最先端の検出器を評価した結果、COCO事前学習モデルを微調整したモデルが、UCFのような低解像度・部分的隠蔽がひどい困難なデータセットにおいて、ドメイン特化型事前学習を用いたモデルを上回ることが判明した。

ABSTRACT

Gun violence is a critical security problem, and it is imperative for the computer vision community to develop effective gun detection algorithms for real-world scenarios, particularly in Closed Circuit Television (CCTV) surveillance data. Despite significant progress in visual object detection, detecting guns in real-world CCTV images remains a challenging and under-explored task. Firearms, especially handguns, are typically very small in size, non-salient in appearance, and often severely occluded or indistinguishable from other small objects. Additionally, the lack of principled benchmarks and difficulty collecting relevant datasets further hinder algorithmic development. In this paper, we present a meticulously crafted and annotated benchmark, called extbf{CCTV-Gun}, which addresses the challenges of detecting handguns in real-world CCTV images. Our contribution is three-fold. Firstly, we carefully select and analyze real-world CCTV images from three datasets, manually annotate handguns and their holders, and assign each image with relevant challenge factors such as blur and occlusion. Secondly, we propose a new cross-dataset evaluation protocol in addition to the standard intra-dataset protocol, which is vital for gun detection in practical settings. Finally, we comprehensively evaluate both classical and state-of-the-art object detection algorithms, providing an in-depth analysis of their generalizing abilities. The benchmark will facilitate further research and development on this topic and ultimately enhance security. Code, annotations, and trained models are available at https://github.com/srikarym/CCTV-Gun.

研究の動機と目的

  • 実世界のCCTV画像における銃器検出のための体系的で整合性のあるベンチマークが不足しているという問題に対処する。ここでの銃器は、小規模で、部分的に隠されており、低解像度である。
  • 実世界の3つのデータセットにまたがる、銃器、保持者、および課題要因(例:ぼやけ、隠蔽)の細分化されたアノテーションを備えた包括的なベンチマークを開発する。
  • 標準的なインラインデータセット評価とは異なり、モデルの汎化性能を評価するための新しいクロスデータセット評価プロトコルを提案する。
  • 本ベンチマーク上で古典的および最先端のオブジェクト検出器を評価し、実世界の課題に直面した際の耐性と性能を分析する。
  • 再現可能性を促進し、公共安全分野における銃器検出分野の研究を加速させるために、コード、アノテーション、および訓練済みモデルを提供する。

提案手法

  • MGD(再現シーン)、USRT(リアルタイム銃器検出)、UCF(犯罪シーンを含むアクション認識)の3つのデータセットから、実世界のCCTV画像を収集・分析した。
  • 人物、銃器、銃器保持者ペアのバウンディングボックスを手動でアノテートし、隠蔽、ぼやけ、類似物体などの課題要因に対しても追加ラベルを付与した。
  • 二重評価プロトコルを設計:インラインデータセット(標準的な訓練/検証/テスト分割)とクロスデータセット(2つのデータセットで訓練、残りの1つでテスト)を用い、汎化性能を評価した。
  • COCOで事前学習したモデルと、銃器特化型データセット(MGD+USRT)で事前学習したモデルを微調整し、ドメイン特化型事前学習が未観測データセットでの性能向上に寄与するかを評価した。
  • YOLOv5、RetinaNet、Swin-T、ConvNeXt-Tなど、複数の最先端オブジェクト検出器を、標準的およびクロスデータセット設定下で評価した。
  • テスト分割に、3つの課題属性(隠蔽、ぼやけ、類似物体)をアノテートし、特定の視覚的劣化下でのモデル耐性を分析した。

実験結果

リサーチクエスチョン

  • RQ1最先端のオブジェクト検出器は、小規模で、部分的に隠されており、低解像度の実世界CCTV画像における銃器検出に対して、どの程度の性能を示すか?
  • RQ2クロスデータセット評価は、標準的なインラインデータセット評価と比較して、モデルの汎化性能に顕著な差を示すか?
  • RQ3MGD+USRTで事前学習したモデルは、UCFのような多様で実世界のデータセットにおいて、COCO事前学習モデルを上回る性能を示すか?
  • RQ4特定の課題要因(隠蔽、ぼやけ、類似物体)は、異なるモデルの検出性能にどのように影響を与えるか?
  • RQ5どのモデルアーキテクチャが、実世界の視覚的劣化および小規模オブジェクトの条件下で最も耐性のある性能を示すか?

主な発見

  • MGD+USRTで訓練したモデルは、クロスデータセット評価においてUCFで性能を発揮しなかった。これは、低解像度・実犯罪シーンのCCTV画像への汎化能力が限定的であることを示唆している。
  • USRT+UCFで訓練したモデルは、MGDで高い性能を示した。これは、明確で高解像度の画像が、より単純な検出タスクへの転移学習を可能にする可能性を示している。
  • COCO事前学習モデルの微調整が、UCFにおいてドメイン特化型事前学習を用いたモデルを上回った。特に、隠蔽度が高く、解像度が低いターゲットデータセットでは顕著であった。
  • ConvNeXt-Tは、6つの課題カテゴリのうち4つ(隠蔽、ぼやけ、類似物体)で最高の平均検出精度(AP)を達成し、優れた耐性を示した。
  • 性能の差が最も顕著に現れたのはUCFであった。低解像度と重度の隠蔽が、検出精度を著しく低下させた。
  • 課題固有の評価から、インラインデータセットでのAPスコアが高いモデルは、常に隠蔽、ぼやけ、類似物体に対してより耐性があることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。