[论文解读] A Survey of Modern Deep Learning based Object Detection Models
本综述对基于深度学习的现代目标检测模型进行了全面分析,涵盖两阶段与单阶段检测器、主干网络架构以及面向边缘部署的轻量化模型。在PASCAL VOC和MS COCO基准上评估了最先进模型,突出展示了精度(AP)与推理速度(FPS)之间的性能权衡,其中DetectoRS在使用ResNeXt-101和输入尺寸1333时于COCO上达到53.3%的AP,创下当时两阶段检测器的新SOTA记录。
Object Detection is the task of classification and localization of objects in an image or video. It has gained prominence in recent years due to its widespread applications. This article surveys recent developments in deep learning based object detectors. Concise overview of benchmark datasets and evaluation metrics used in detection is also provided along with some of the prominent backbone architectures used in recognition tasks. It also covers contemporary lightweight classification models used on edge devices. Lastly, we compare the performances of these architectures on multiple metrics.
研究动机与目标
- 提供对基于深度学习的目标检测模型近期进展的系统性综述,涵盖两阶段与单阶段检测器。
- 分析并比较现代目标检测器中使用的主流主干网络架构,如ResNet、ResNeXt和Swin Transformers。
- 评估为边缘和移动设备优化的轻量化神经网络模型,重点关注效率与精度之间的权衡。
- 在多个指标上呈现目标检测器的对比分析,包括平均平均精度(AP)、推理速度(FPS)和计算复杂度。
- 识别目标检测领域的当前趋势与未来方向,特别是在效率、模型压缩和硬件感知设计方面。
提出的方法
- 本文对目标检测模型进行了结构化综述,将其分类为两阶段(如Faster R-CNN、Mask R-CNN)和单阶段(如YOLO、SSD、RetinaNet)检测器。
- 基于其在检测任务中特征提取的性能,评估了ResNet、ResNeXt、EfficientNet和Swin Transformers等主干网络。
- 分析了MobileNet、ShuffleNet、SqueezeNet和OFA等轻量化模型的效率,指标包括Top-1精度、延迟、参数量和FLOPs。
- 在标准基准PASCAL VOC 2012和MS COCO上进行模型比较,使用标准评估指标:COCO的AP(IoU ≥ 0.5)和AP[0.5:0.95]。
- 基于原始论文报告的结果进行对比分析,重点关注精度(AP)、推理速度(FPS)和模型复杂度(FLOPs)。
- 考察了Once-for-All(OFA)方法作为一种新型高效架构设计方法,可实现单个模型蒸馏出具有不同深度、宽度和卷积核大小的子网络。

实验结果
研究问题
- RQ1在标准基准上,现代两阶段与单阶段目标检测模型在精度与推理速度方面如何比较?
- RQ2哪些主干网络架构在目标检测中实现了精度与计算效率的最佳权衡?
- RQ3像MobileNet、ShuffleNet和OFA这样的轻量化模型在边缘部署中的精度、延迟和FLOPs方面表现如何?
- RQ4在PASCAL VOC和MS COCO数据集上训练的模型之间,关键性能差异是什么,特别是IoU阈值和AP指标方面?
- RQ5Once-for-All(OFA)框架如何在无需微调的情况下实现高效模型压缩与硬件感知架构搜索?
主要发现
- DetectoRS在使用ResNeXt-101和输入尺寸1333时,于MS COCO上达到53.3%的AP,创下当时两阶段检测器的新SOTA记录。
- YOLOv4在MS COCO上实现43.0% AP和64.9% AP,推理速度达31 FPS,展现出优异的实时性能。
- EfficientDet-D2在COCO上实现43.0% AP和62.3% AP,FLOPs为41.7,展现出高效率与精度的平衡。
- OFA在ImageNet上实现80.0% Top-1精度,延迟58ms,FLOPs为595,赢得第四届低功耗计算机视觉挑战赛第4名。
- 轻量化模型如MobileNetV3和OFA在FLOPs低于600 MFLOPs时实现超过75%的Top-1精度,适用于移动与边缘设备。
- CenterNet在COCO上实现42.1% AP和61.1% AP,推理速度为7.8 FPS,展现出在关键点检测任务中的强劲性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。