Skip to main content
QUICK REVIEW

[论文解读] Salience Biased Loss for Object Detection in Aerial Images

Peng Sun, Guang Chen|arXiv (Cornell University)|Oct 18, 2018
Advanced Neural Network Applications参考文献 18被引用 13
一句话总结

本文提出显著性偏差损失(SBL),一种新颖的损失函数,通过基于图像显著性动态加权训练样本,以提升航拍图像中的目标检测性能。通过聚焦于复杂、难以检测的样本进行训练,SBL-RetinaNet 在 DOTA 数据集上相比最先进模型实现了 4.31 mAP 的提升,同时保持与 RetinaNet 相同的推理速度。

ABSTRACT

Object detection in remote sensing, especially in aerial images, remains a challenging problem due to low image resolution, complex backgrounds, and variation of scale and angles of objects in images. In current implementations, multi-scale based and angle-based networks have been proposed and generate promising results with aerial image detection. In this paper, we propose a novel loss function, called Salience Biased Loss (SBL), for deep neural networks, which uses salience information of the input image to achieve improved performance for object detection. Our novel loss function treats training examples differently based on input complexity in order to avoid the over-contribution of easy cases in the training process. In our experiments, RetinaNet was trained with SBL to generate an one-stage detector, SBL-RetinaNet. SBL-RetinaNet is applied to the largest existing public aerial image dataset, DOTA. Experimental results show our proposed loss function with the RetinaNet architecture outperformed other state-of-art object detection models by at least 4.31 mAP, and RetinaNet by 2.26 mAP with the same inference speed of RetinaNet.

研究动机与目标

  • 解决航拍图像目标检测中因简单样本主导训练而引发的类别不平衡问题,阻碍模型收敛。
  • 提升在具有极端尺度变化、任意物体方向和杂乱背景的复杂航拍图像上的检测性能。
  • 在不增加推理速度的前提下,通过新型训练目标函数提升精度,保持与 RetinaNet 相同的推理速度。
  • 开发一种自适应优先处理图像中困难、显著区域的损失函数,以提升模型泛化能力。
  • 在无需架构修改的前提下,证明 SBL 在大规模航拍数据集(如 DOTA 和 LBAI)上的有效性。

提出的方法

  • 从预训练的 ResNet50 主干网络的中间卷积特征(如 C2、C5)中提取显著性图,以量化图像复杂度。
  • 利用特征图中显著区域的空间分布,为每个训练样本计算基于显著性的权重。
  • 将显著性加权损失集成到 RetinaNet 的标准分类与回归头中,以 SBL 替代标准交叉熵损失。
  • 采用 SBL 与平滑 L1 损失的加权组合进行边界框回归与分类,其中损失贡献按显著性进行缩放。
  • 使用 Adam 优化器与余弦衰减学习率调度策略进行 SBL-RetinaNet 的训练,输入分辨率固定(DOTA 为 1024×1024,LBAI 为 512×512)。
  • 通过消融实验选择最优显著性层级(C2),其在 mAP 提升方面表现最佳,超过基线 RetinaNet。

实验结果

研究问题

  • RQ1一种优先处理航拍图像中显著、复杂区域的损失函数,是否能在不增加推理成本的前提下提升目标检测性能?
  • RQ2基于显著性的加权方式与标准交叉熵损失相比,在处理航拍图像检测中的类别不平衡问题时表现如何?
  • RQ3所提出的 SBL 损失是否能在具有不同物体尺度与背景复杂度的多样化航拍图像数据集上实现泛化?
  • RQ4SBL-RetinaNet 是否能在 DOTA 等大规模基准上超越最先进模型,同时保持原始推理速度?
  • RQ5哪个特征层(如 C2、C5)能提供最有效的显著性表征,以指导航拍检测中的损失加权?

主要发现

  • 在 DOTA 数据集上,SBL-RetinaNet 相较于最接近的竞争对手 Faster R-CNN 实现了 4.31 mAP 的显著提升,显著优于现有最先进模型。
  • 在 DOTA 测试集上,SBL-RetinaNet 达到 64.77 mAP,而经过锚框尺寸调优的 RetinaNet 为 62.51 mAP,mAP 提升 2.26%,且推理速度完全一致。
  • 在 LBAI 数据集上,SBL-RetinaNet 的 F1 分数达到 92.49%,相比修改后的 RetinaNet 基线(91.18%)提升 1.31%,展现出强大的泛化能力。
  • C2 特征图提供了最优的显著性表征,实现了最高的 mAP 提升,表明早期特征能捕捉到有用的复杂度线索。
  • 该模型保持了与标准 RetinaNet 相同的推理速度,证实 SBL 在部署阶段无额外计算开销。
  • 可视化结果表明,SBL-RetinaNet 更好地检测到小尺寸、密集排列及旋转的物体——这些是航拍图像中的常见挑战,尤其在复杂背景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。