Skip to main content
QUICK REVIEW

[论文解读] MRDet: A Multi-Head Network for Accurate Oriented Object Detection in Aerial Images

Qin Ran, Qingjie Liu|arXiv (Cornell University)|Dec 24, 2020
Advanced Neural Network Applications参考文献 51被引用 7
一句话总结

MRDet 提出了一种用于航空影像的轻量化多头旋转目标检测器,采用任意方向区域建议网络(AO-RPN)在几乎不增加参数量的情况下生成高精度的旋转建议框,并通过多头网络解耦分类、定位、尺度和方向预测任务以提升检测精度。该方法在 DOTA 数据集上达到 76.24% 的 mAP,在 HRSC2016 数据集上达到 89.94% 的 mAP,性能达到当前最先进水平。

ABSTRACT

Objects in aerial images usually have arbitrary orientations and are densely located over the ground, making them extremely challenge to be detected. Many recently developed methods attempt to solve these issues by estimating an extra orientation parameter and placing dense anchors, which will result in high model complexity and computational costs. In this paper, we propose an arbitrary-oriented region proposal network (AO-RPN) to generate oriented proposals transformed from horizontal anchors. The AO-RPN is very efficient with only a few amounts of parameters increase than the original RPN. Furthermore, to obtain accurate bounding boxes, we decouple the detection task into multiple subtasks and propose a multi-head network to accomplish them. Each head is specially designed to learn the features optimal for the corresponding task, which allows our network to detect objects accurately. We name it MRDet short for Multi-head Rotated object Detector for convenience. We test the proposed MRDet on two challenging benchmarks, i.e., DOTA and HRSC2016, and compare it with several state-of-the-art methods. Our method achieves very promising results which clearly demonstrate its effectiveness.

研究动机与目标

  • 利用深度学习解决在航空影像中检测密集排列、任意方向目标的挑战。
  • 通过避免密集锚框设置,降低旋转目标检测中的计算成本和模型复杂度。
  • 通过专用网络头解耦检测子任务,提升检测精度。
  • 在高密度场景下实现效率与性能的平衡,适用于任意方向目标。
  • 在 DOTA 和 HRSC2016 基准数据集上实现旋转目标检测的最先进性能。

提出的方法

  • 提出一种任意方向区域建议网络(AO-RPN),通过学习仿射变换将水平建议框转换为旋转建议框,同时保持与标准 RPN 相同的锚框数量。
  • 引入一种多头网络(MH-Net),包含四个并行子头,分别用于分类、边界框定位、尺度估计和方向预测,每个子头针对其特定任务进行优化。
  • 在定位头中引入中心池化模块,以增强特征表示,提升边界框回归的精度。
  • 采用全连接层进行方向预测,经验证其在精度上优于卷积分支。
  • 利用特征金字塔网络(FPN)提升对小目标和多尺度目标的检测能力。
  • 采用端到端训练方式,损失函数结合分类损失、定位损失、尺度损失和方向预测损失的多任务损失。

实验结果

研究问题

  • RQ1轻量级区域建议网络是否能在不增加锚框密度或计算成本的前提下生成高精度的旋转建议框?
  • RQ2通过独立网络头解耦检测子任务(分类、定位、尺度、方向)是否能提升航空影像中的检测精度?
  • RQ3定位头中的中心池化模块对旋转目标检测中边界框回归性能有何影响?
  • RQ4所提出的多头设计在检测小目标、密集排列及任意方向目标方面,相较于共享头架构的性能优势有多大?
  • RQ5该方法是否能在具有不同目标尺度、长宽比和方向的多样化航空影像数据集中实现良好泛化?

主要发现

  • 在使用 FPN 的 DOTA 数据集上,MRDet 实现了 76.24% 的平均精度均值(mAP),较之前最佳结果(75.74%)提升 0.5%。
  • 在不使用 FPN 的 DOTA 数据集上,MRDet 实现了 73.62% 的 mAP,较之前最佳方法(61.01%)提升 12.55 个百分点。
  • 对于大型车辆和船舶——由于密度高且方向相似而具有挑战性的类别——MRDet 分别将 mAP 提升 2.23% 和 1.04%。
  • 在 HRSC2016 数据集上,MRDet 实现了 89.94% 的 mAP,较第二名方法(88.20%)提升 1.74%,较 RoI Transformer 提升 3.74%。
  • 可视化对比显示,与 RoI Transformer、Gliding Vertex 和 SCRDet 相比,MRDet 能够检测到更紧密且更精确的边界框,尤其在小目标和低分辨率目标上表现更优。
  • 该方法在极大型或高长宽比目标(如桥梁)上表现有限,mAP 仅为 55.40%,表明类别不平衡和尺度变化仍是待解决的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。