Skip to main content
QUICK REVIEW

[论文解读] YouTube-GDD: A challenging gun detection dataset with rich contextual information

Yongxiang Gu, Xingbin Liao|arXiv (Cornell University)|Mar 8, 2022
Rabies epidemiology and control被引用 9
一句话总结

本文提出 YouTube-GDD,一个高质量、动态的枪支检测数据集,包含来自343段高清YouTube视频的5,000张图像,共标注了16,064个枪支实例和9,046个人体实例。通过引入人体标注,该数据集在结合迁移学习时,使YOLOv5s的AP50提升2.3个百分点,AP提升0.1个百分点,显著提升了检测性能。

ABSTRACT

An automatic gun detection system can detect potential gun-related violence at an early stage that is of paramount importance for citizens security. In the whole system, object detection algorithm is the key to perceive the environment so that the system can detect dangerous objects such as pistols and rifles. However, mainstream deep learning-based object detection algorithms depend heavily on large-scale high-quality annotated samples, and the existing gun datasets are characterized by low resolution, little contextual information and little data volume. To promote the development of security, this work presents a new challenging dataset called YouTube Gun Detection Dataset (YouTube-GDD). Our dataset is collected from 343 high-definition YouTube videos and contains 5000 well-chosen images, in which 16064 instances of gun and 9046 instances of person are annotated. Compared to other datasets, YouTube-GDD is "dynamic", containing rich contextual information and recording shape changes of the gun during shooting. To build a baseline for gun detection, we evaluate YOLOv5 on YouTube-GDD and analyze the influence of additional related annotated information on gun detection. YouTube-GDD and subsequent updates will be released at https://github.com/UCAS-GYX/YouTube-GDD.

研究动机与目标

  • 解决真实监控应用中缺乏高质量、大规模且具备丰富上下文信息的枪支检测数据集的问题。
  • 克服现有数据集存在的低分辨率、上下文信息有限以及与真实监控画面分布不一致的局限性。
  • 通过引入人体标注作为辅助监督信号,提升模型泛化能力与检测性能,增强枪支检测的鲁棒性。
  • 通过发布YouTube-GDD并以YOLOv5s作为强基准模型进行评估,建立枪支检测的基准测试标准。

提出的方法

  • 从343段高清YouTube视频中收集5,000张高分辨率图像,构建一个具有动态枪支外观的多样化真实世界数据集。
  • 标注16,064个枪支实例和9,046个人体实例,以提供丰富的上下文与空间关系信息,提升检测效果。
  • 使用Jensen-Shannon散度将数据集划分为10个折,确保尺度分布均衡,并指定第6折(验证集)和第7折(测试集)用于评估。
  • 使用COCO预训练权重进行迁移学习,训练YOLOv5s模型,并采用COCO风格指标(AP与AP50)评估性能。
  • 通过训练是否包含人体检测头的模型,评估额外人体标注对性能的影响,比较性能增益。
  • 采用标准训练协议:输入尺寸640×640,SGD优化器,训练300个周期,包含学习率预热,并使用NMS进行后处理。

实验结果

研究问题

  • RQ1一个大规模、高质量、包含动态枪支外观与上下文信息的数据集,是否能提升枪支检测性能?
  • RQ2在复杂真实场景中,引入人体标注如何影响枪支检测模型的性能表现?
  • RQ3从COCO预训练进行迁移学习,在YouTube-GDD数据集上能在多大程度上提升检测准确率?
  • RQ4在包含多样化枪支尺度、姿态及射击过程中的动态变化的测试集上,SOTA检测器如YOLOv5s的鲁棒性如何?
  • RQ5添加人体标注在AP与AP50上的性能增益是多少?该增益是否在计算开销极小的情况下依然显著?

主要发现

  • 在使用迁移学习的前提下,向YOLOv5s模型中加入人体标注,使AP50提升2.3个百分点,AP提升0.1个百分点,证明了上下文监督的价值。
  • 从头开始训练并加入人体标注后,AP50提升0.2个百分点,AP提升0.3个百分点,表明性能增益具有持续性。
  • 同时采用迁移学习与人体标注的模型,在枪支检测上达到77.3%的AP50与52.1%的AP,在人体检测上达到92.4%的AP50与81.2%的AP。
  • 该数据集的动态特性——捕捉射击过程中枪支形状的变化——对现有检测器构成重大挑战,凸显了对鲁棒、上下文感知模型的需求。
  • 人体标注的引入计算开销可忽略不计,GFLOPs与参数数量基本保持不变(15.81 GFLOPs,7.02M参数)。
  • YouTube-GDD非常适合用于评估模型的泛化能力与鲁棒性,因其比静态、低质量的数据集更能反映真实世界视频的分布特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。