Skip to main content
QUICK REVIEW

[论文解读] Adaptive Sparse Convolutional Networks with Global Context Enhancement for Faster Object Detection on Drone Images

Bowei Du, Yecheng Huang|arXiv (Cornell University)|Mar 25, 2023
Advanced Neural Network Applications被引用 6
一句话总结

本文提出CEASC,一种用于无人机目标检测的即插即用检测头优化方法,结合上下文增强的稀疏卷积与自适应多层掩码,以平衡精度与效率。通过引入一种新型组归一化层增强全局上下文,并动态调整每层特征金字塔的掩码比例,CEASC在VisDrone和UAVDT数据集上分别将GFLOPs降低76.3%、推理速度提升60%,同时mAP分别提升0.3%和0.2%。

ABSTRACT

Object detection on drone images with low-latency is an important but challenging task on the resource-constrained unmanned aerial vehicle (UAV) platform. This paper investigates optimizing the detection head based on the sparse convolution, which proves effective in balancing the accuracy and efficiency. Nevertheless, it suffers from inadequate integration of contextual information of tiny objects as well as clumsy control of the mask ratio in the presence of foreground with varying scales. To address the issues above, we propose a novel global context-enhanced adaptive sparse convolutional network (CEASC). It first develops a context-enhanced group normalization (CE-GN) layer, by replacing the statistics based on sparsely sampled features with the global contextual ones, and then designs an adaptive multi-layer masking strategy to generate optimal mask ratios at distinct scales for compact foreground coverage, promoting both the accuracy and efficiency. Extensive experimental results on two major benchmarks, i.e. VisDrone and UAVDT, demonstrate that CEASC remarkably reduces the GFLOPs and accelerates the inference procedure when plugging into the typical state-of-the-art detection frameworks (e.g. RetinaNet and GFL V1) with competitive performance. Code is available at https://github.com/Cuogeihong/CEASC.

研究动机与目标

  • 解决资源受限的无人机平台在轻量化目标检测中精度与推理效率之间的平衡挑战。
  • 克服现有稀疏卷积方法在无人机图像中的局限性,避免因固定或次优掩码比例导致性能下降,尤其在前景尺度变化大且分布稀疏的情况下。
  • 通过整合全局上下文信息,改进稀疏卷积中的特征表示,以稳定前景特征分布并减少精度下降。
  • 设计一种自适应、逐层的掩码策略,按特征金字塔层级优化掩码比例,以在最小化计算成本的同时最大化检测精度。
  • 开发一种可泛化的即插即用解决方案,兼容SOTA检测器如RetinaNet和GFL V1,适用于无人机平台的高效部署。

提出的方法

  • 提出一种上下文增强的组归一化(CE-GN)层,用全局上下文统计量替代稀疏采样特征的统计量,以保留整体特征表示并稳定前景分布。
  • 引入一种上下文增强的稀疏卷积(CESC)模块,将CE-GN集成到残差块中,以增强稀疏卷积设置下的特征学习能力。
  • 设计一种自适应多层掩码(AMM)方案,通过可学习损失函数独立计算每层FPN的最优掩码比例,实现对不同前景尺度的动态适应。
  • 采用逐层掩码策略,为每个FPN层级估计掩码比例,通过考虑各层特征重要性与稀疏性的差异,优于全局掩码比例方法。
  • 将CEASC框架作为插件模块应用于现有检测器(如GFL V1和RetinaNet),实现高效推理而无需修改网络架构。
  • 使用可微分损失函数联合优化掩码比例与检测性能,确保稀疏卷积聚焦于紧凑且信息丰富的区域,同时最小化冗余计算。

实验结果

研究问题

  • RQ1能否有效将全局上下文整合到稀疏卷积网络中,以稳定特征分布并减少小目标检测中的精度下降?
  • RQ2如何在不同特征金字塔层级上自适应控制掩码比例,以在无人机图像中平衡检测精度与计算效率?
  • RQ3与全局掩码比例相比,逐层自适应掩码策略是否在处理高分辨率无人机图像中尺度多变的前景对象时表现更优?
  • RQ4即插即用的稀疏卷积头在保持或提升mAP的同时,能在多大程度上减少GFLOPs并加速推理?
  • RQ5所提方法是否能在无需微调的情况下,泛化至不同SOTA检测器和数据集(如VisDrone和UAVDT)?

主要发现

  • 在VisDrone数据集上,使用ResNet18骨干网络的GFL V1检测器中,CEASC将GFLOPs降低71.4%,推理FPS提升60%,同时mAP提升0.3%。
  • 在UAVDT数据集上,CEASC将GFLOPs降低76.3%,推理速度提升38.9%,mAP提升0.2%,相比基线GFL V1。
  • 自适应多层掩码(AMM)策略优于固定掩码比例,最优掩码比例在不同数据集中有所差异(VisDrone为0.9,UAVDT为0.95),证明了自适应的必要性。
  • 逐层AMM方法显著优于全局掩码比例方法,因能更好地处理层间特征差异,从而实现更高的mAP和FPS。
  • 移除高层FPN特征(P6-P7)对mAP影响极小,但移除P4导致性能急剧下降,证实P4在检测精度中的关键作用。
  • CEASC在所有评估方法中,卷积类方法中GFLOPs最低,FPS最高,展现出在无人机检测基准上卓越的效率-精度权衡能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。