[论文解读] Object detection on aerial imagery using CenterNet
本论文在 VisDrone2019 数据集上评估了 CenterNet——一种基于关键点的一阶段目标检测器——在航空影像目标检测中的表现,采用多种主干网络和测试时增强策略。在图像检测任务中取得 27.83% mAP(第7名),在视频检测任务中取得 21.58% mAP(第5名),表明该方法在无需微调的情况下,对无人机影像中尺寸小、密集排列的目标具有优异的检测性能。
Detection and classification of objects in aerial imagery have several applications like urban planning, crop surveillance, and traffic surveillance. However, due to the lower resolution of the objects and the effect of noise in aerial images, extracting distinguishing features for the objects is a challenge. We evaluate CenterNet, a state of the art method for real-time 2D object detection, on the VisDrone2019 dataset. We evaluate the performance of the model with different backbone networks in conjunction with varying resolutions during training and testing.
研究动机与目标
- 解决使用深度学习检测航空影像中尺寸小、分辨率低且密集聚集的目标的挑战。
- 评估 CenterNet——一种基于关键点的一阶段检测器——在航空影像上相对于传统两阶段和一阶段检测器的有效性。
- 研究不同主干网络(ResNet-18、DLA-34、Hourglass-104)和测试时增强策略对检测性能的影响。
- 评估在图像数据上训练的单一模型在未重新训练或微调的情况下对视频目标检测任务的泛化能力。
提出的方法
- CenterNet 将目标表示为单个关键点中心,从中心热力图回归边界框大小及其他属性。
- 模型使用在 COCO 上预训练的 Hourglass-104 主干网络进行特征提取和检测头设计。
- 训练时将图像调整为 1024×1024,推理时调整为 2048×2048,并进行 ImageNet 归一化。
- 测试时增强包括水平翻转和在输入分辨率的 0.5、0.75、1.0、1.25、1.5 倍尺度下的多尺度推理。
- 优化使用 ADAM 优化器,初始初始学习率为 2.5×10⁻⁴,在第 90 和第 120 个周期时按因子 10 进行衰减。
- 评估使用在 IOU 阈值从 0.5 到 0.95、步长为 0.05 的平均精度(AP),以及在多个检测数量限制下的平均召回率。
实验结果
研究问题
- RQ1与 YOLOv3 和 SSD 等传统一阶段检测器相比,CenterNet 在航空影像上的表现如何?
- RQ2在 VisDrone2019 上,哪种主干网络(ResNet-18、DLA-34、Hourglass-104)能实现最佳检测精度?
- RQ3测试时增强策略(水平翻转、多尺度测试)在多大程度上提升了检测性能?
- RQ4在未进行微调的情况下,仅在图像数据上训练的模型能否有效泛化到视频目标检测任务?
主要发现
- 在 2048×2048 分辨率下,采用多尺度测试和水平翻转的 Hourglass-104 主干网络在验证集上达到最高的 mAP 58.03%。
- 测试时增强显著提升了性能,mAP 从无翻转时的 56.88% 提升至有翻转时的 58.03%(在 2048×2048 分辨率下)。
- 在 VisDrone2019 Track 1(图像检测)中,该模型取得 27.83% mAP,位列 20 种参赛方法中的第 7 名。
- 在 Track 2(视频检测)中,同一模型取得 21.58% mAP,未进行任何重新训练或微调,排名 leaderboard 第 5 名。
- 在 Track 1 中,该模型的平均召回率最高(46.81%),尤其在每幅图像检测最多 500 个目标时表现优异。
- 类别级性能显示,汽车(图像上 AP 为 51.92%)和卡车(图像上 AP 为 31.14%)表现强劲,对公共汽车和小型货车也表现出显著性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。