Skip to main content
QUICK REVIEW

[论文解读] YOLO v3: Visual and Real-Time Object Detection Model for Smart Surveillance Systems(3s)

Kanyifeechukwu Jane Oguine, Ozioma Collins Oguine|arXiv (Cornell University)|Sep 26, 2022
Advanced Neural Network Applications被引用 4
一句话总结

本文提出了一种基于 YOLO v3 的实时目标检测模型,用于智能监控系统(3s),在 MS COCO 数据集上使用迁移学习,实现了 99.71% 的准确率和 61.5 的 mAP。该模型利用 YOLO v3 的多尺度特征提取能力和 Darknet-53 主干网络,在减少训练时间和计算成本的前提下,实现了在真实世界监控视频中的高效、高精度检测。

ABSTRACT

Can we see it all? Do we know it All? These are questions thrown to human beings in our contemporary society to evaluate our tendency to solve problems. Recent studies have explored several models in object detection; however, most have failed to meet the demand for objectiveness and predictive accuracy, especially in developing and under-developed countries. Consequently, several global security threats have necessitated the development of efficient approaches to tackle these issues. This paper proposes an object detection model for cyber-physical systems known as Smart Surveillance Systems (3s). This research proposes a 2-phase approach, highlighting the advantages of YOLO v3 deep learning architecture in real-time and visual object detection. A transfer learning approach was implemented for this research to reduce training time and computing resources. The dataset utilized for training the model is the MS COCO dataset which contains 328,000 annotated image instances. Deep learning techniques such as Pre-processing, Data pipelining, and detection was implemented to improve efficiency. Compared to other novel research models, the proposed model's results performed exceedingly well in detecting WILD objects in surveillance footages. An accuracy of 99.71% was recorded, with an improved mAP of 61.5.

研究动机与目标

  • 通过提出一种智能、实时的目标检测系统,解决发展中国家和欠发达国家人工监控效率低下的问题。
  • 利用深度学习,特别是 YOLO v3,提升智能监控系统中的目标检测准确率和速度。
  • 通过在 MS COCO 数据集上应用迁移学习,减少训练时间和计算资源需求。
  • 通过信息物理系统框架,实现在真实世界(WILD)环境中对多样化对象的鲁棒检测。
  • 通过自动化、高精度、快速检测威胁(如武器、盗窃、火灾爆发)等,提升安全性。

提出的方法

  • 采用 YOLO v3 架构与 Darknet-53 主干网络,结合特征金字塔网络(FPN),实现实时、单次目标检测。
  • 使用 ImageNet 预训练权重进行迁移学习,以加速在 MS COCO 数据集上的收敛并减少训练时间。
  • 实施数据预处理、数据流水线和批量处理,以优化推理速度和模型效率。
  • 通过在不同尺度(3 个尺度)的特征图上进行多尺度预测,检测监控视频中尺寸各异的物体。
  • 应用非极大值抑制(NMS)和交并比(IoU)阈值处理,优化边界框预测并减少冗余。
  • 在从真实野外环境采集的监控视频数据上训练和评估模型,以模拟真实世界条件。
Figure 1: YOLO v3 vs. RetinaNet: Speed/Accuracy Chart [ 6 ]
Figure 1: YOLO v3 vs. RetinaNet: Speed/Accuracy Chart [ 6 ]

实验结果

研究问题

  • RQ1基于 YOLO v3 的模型是否能在资源受限环境中实现智能监控系统的高准确率与实时性能?
  • RQ2在 MS COCO 数据集上应用于监控应用时,迁移学习对训练效率和检测准确率有何影响?
  • RQ3YOLO v3 在检测监控视频中多样化真实世界物体方面,相较于 Faster R-CNN 和 SSD 等现有模型,优势有多大?
  • RQ4所提模型在真实世界、野外环境监控视频上的 mAP 和准确率表现如何?
  • RQ5YOLO v3 与信息物理系统框架的集成,是否能够实现低延迟、高精度的可扩展智能监控?

主要发现

  • 所提出的 YOLO v3 模型在真实监控视频画面上实现了 99.71% 的检测准确率,显著优于现有模型。
  • 模型的平均平均精度(mAP)达到 61.5,表明其在多样化物体类别中具备出色的泛化能力和检测能力。
  • 在对比评估中,该模型在相同测试设置下超越了 Faster R-CNN(95.4%)和定制 YOLO v3(98.89%)等现有模型。
  • 迁移学习的应用在保持高检测性能的同时,显著减少了训练时间和计算资源需求。
  • 该模型在多个测试视频中表现出稳健性能,多数情况下精确率和召回率均超过 0.92。
  • 图 12 中的视觉标注证实了在复杂实时监控画面中对物体的准确定位与分类。
Figure 2: Description of Darknet-53 Framework.
Figure 2: Description of Darknet-53 Framework.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。