Skip to main content
QUICK REVIEW

[論文レビュー] YouTube-GDD: A challenging gun detection dataset with rich contextual information

Yongxiang Gu, Xingbin Liao|arXiv (Cornell University)|Mar 8, 2022
Rabies epidemiology and control被引用数 9
ひとこと要約

本稿では、343本のHD YouTube動画から抽出した5,000枚の画像を含む、高品質で動的な銃検出データセットであるYouTube-GDDを紹介する。このデータセットには16,064件の銃インスタンスと9,046件の人物インスタンスがアノテートされており、検出性能の向上に寄与する。人物アノテーションを組み込むことで、転移学習を用いたYOLOv5sのAPがAP50で2.3ポイント、APで0.1ポイント向上した。

ABSTRACT

An automatic gun detection system can detect potential gun-related violence at an early stage that is of paramount importance for citizens security. In the whole system, object detection algorithm is the key to perceive the environment so that the system can detect dangerous objects such as pistols and rifles. However, mainstream deep learning-based object detection algorithms depend heavily on large-scale high-quality annotated samples, and the existing gun datasets are characterized by low resolution, little contextual information and little data volume. To promote the development of security, this work presents a new challenging dataset called YouTube Gun Detection Dataset (YouTube-GDD). Our dataset is collected from 343 high-definition YouTube videos and contains 5000 well-chosen images, in which 16064 instances of gun and 9046 instances of person are annotated. Compared to other datasets, YouTube-GDD is "dynamic", containing rich contextual information and recording shape changes of the gun during shooting. To build a baseline for gun detection, we evaluate YOLOv5 on YouTube-GDD and analyze the influence of additional related annotated information on gun detection. YouTube-GDD and subsequent updates will be released at https://github.com/UCAS-GYX/YouTube-GDD.

研究の動機と目的

  • 実際の監視応用に適した、豊富な文脈的情報を備えた高品質で大規模な銃検出データセットの不足を解消すること。
  • 従来のデータセットが低解像度、限られた文脈的情報、実際の監視映像と一致しない分布を抱えるという限界を克服すること。
  • 人物アノテーションを補助的監視として組み込むことで、モデルの汎化性能と検出性能を向上させ、銃検出のロバスト性を高めること。
  • YouTube-GDDの公開とYOLOv5sを強力なベースラインモデルとして評価することで、銃検出のベンチマークを確立すること。

提案手法

  • 343本のHD YouTube動画から5,000枚の高解像度画像を収集し、動的な銃の出現を再現する多様な実世界データセットを構築した。
  • 16,064件の銃インスタンスと9,046件の人物インスタンスをアノテートすることで、検出のための豊富な文脈的・空間的関係を提供した。
  • Jensen-Shannonダイバージェンスを用いて10分割に分割し、スケール分布のバランスを確保した。評価用にfold 6(検証)とfold 7(テスト)を指定した。
  • COCO事前学習重みから転移学習を用いてYOLOv5sを訓練し、COCOスタイルの指標(APとAP50)を用いて性能を評価した。
  • 人物アノテーションの影響を評価するため、人物検出ヘッドを有する・なしのモデルを訓練し、性能向上を比較した。
  • 標準的な訓練プロトコルを採用:入力サイズ640×640、SGD最適化手法、300エポック、ウォームアップ、NMSを後処理に使用した。

実験結果

リサーチクエスチョン

  • RQ1動的な銃の出現と文脈的情報を備えた大規模で高品質なデータセットは、銃検出性能の向上に寄与するか?
  • RQ2複雑な実世界の状況下で、人物アノテーションを組み込むことで、銃検出モデルの性能にどのような影響を与えるか?
  • RQ3COCO事前学習からの転移学習は、YouTube-GDDデータセットにおける検出精度をどの程度向上させるか?
  • RQ4YOLOv5sのような最先端の検出器は、多様な銭のスケール、ポーズ、発砲中の動的変化を伴うデータセットに対して、どの程度ロバストか?
  • RQ5APとAP50の向上は、最小限の計算コスト増加の下で有意義なものか、人物アノテーションの追加による性能向上はどの程度か?

主な発見

  • 転移学習を用いたYOLOv5sモデルに人物アノテーションを追加することで、AP50が2.3ポイント、APが0.1ポイント向上し、文脈的監視の価値を示した。
  • 人物アノテーションを含めた学習からスタートした場合、AP50が0.2ポイント、APが0.3ポイント向上し、一貫した性能向上が得られた。
  • 転移学習と人物アノテーションの両方を適用したモデルでは、銃検出で77.3%のAP50と52.1%のAPを達成し、人物検出では92.4%のAP50と81.2%のAPを達成した。
  • 発砲中の形状変化を捉えたデータセットの動的性質は、既存の検出器にとって顕著な課題をもたらし、ロバストで文脈に配慮したモデルの必要性を浮き彫りにした。
  • 人物アノテーションの導入による計算コストの増加はほとんどなく、GFLOPsとパラメータ数はほぼ変化しなかった(15.81 GFLOPs、7.02Mパラメータ)。
  • YouTube-GDDは、静的で低品質なデータセットよりも実際の動画分布をよりよく反映しているため、汎化性能とロバスト性の評価に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。