Skip to main content
QUICK REVIEW

[论文解读] DOTA: A Large-scale Dataset for Object Detection in Aerial Images

Gui-Song Xia|arXiv (Cornell University)|Nov 28, 2017
Advanced Neural Network Applications参考文献 40被引用 137
一句话总结

介绍 DOTA,一个大规模的无人机/航空图像对象检测数据集,具有15个定向类别、188,282个实例和2806张高分辨率图像;为水平和定向边框检测提供基线。

ABSTRACT

Example datasets of the Interactive Feature Localization in Deep neural networks (IFeaLiD) tool. <strong>Cityscapes</strong> These datasets are based on the image <code>bielefeld_000000_007186_leftImg8bit.png</code> of the Cityscapes dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>bielefeld_000000_007186_leftImg8bit.png.C1.npz.8.zip</code>) conv3_x (<code>bielefeld_000000_007186_leftImg8bit.png.C2.npz.8.zip</code>) conv4_x (<code>bielefeld_000000_007186_leftImg8bit.png.C3.npz.8.zip</code>) <strong>COCO</strong> These datasets are based on the image <code>000000015746.jpg</code> of the COCO dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>000000015746.jpg.C1.npz.8.zip</code>) conv3_x (<code>000000015746.jpg.C2.npz.8.zip</code>) conv4_x (<code>000000015746.jpg.C3.npz.8.zip</code>) <strong>DIV2K</strong> These datasets are based on the image <code>0804.png</code> of the DIV2K dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>0804.png.C1.npz.8.zip</code>) conv3_x (<code>0804.png.C2.npz.8.zip</code>) conv4_x (<code>0804.png.C3.npz.8.zip</code>) <strong>DOTA</strong> These datasets are based on the image <code>P0034.png</code> of the DOTA dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>P0034.png.C1.npz.8.zip</code>) conv3_x (<code>P0034.png.C2.npz.8.zip</code>) conv4_x (<code>P0034.png.C3.npz.8.zip</code>)

研究动机与目标

  • 通过提供一个大规模、多样化、高分辨率的数据集,反映现实世界地球视觉挑战,来推动并实现鲁棒的航空影像对象检测。
  • 定义定向边界框注释,以更好地包围航空场景中的对象并减少对象之间的重叠。
  • 建立使用最先进检测器的基线,覆盖水平边界框(HBB)和定向边界框(OBB)。
  • 强调稠密场景、极端纵横比和大规模类内变化的挑战,以引导未来算法发展。

提出的方法

  • 从多种传感器/平台收集高达4000x4000分辨率的2806张航空图像。
  • 在15个类别中,用任意方向的四边形边界框标注188,282个对象实例。
  • 为每张图像提供空间分辨率元数据,以将对象大小置于上下文中。
  • 通过将 Faster R-CNN 类型框架改用于OBB,以及用于HBB的标准检测器来评估基线,包括由于图像尺度较大而进行的基于块的处理。
  • 裁剪策略:生成1024x1024的块,步长512,以便CNN处理,并通过非极大抑制合并结果。

实验结果

研究问题

  • RQ1现有目标检测器在具有高度变化的尺度和方向的航空影像上的泛化能力如何?
  • RQ2在水平边界框和定向边界框上经过训练的检测器在航空数据上的性能差距是多少?
  • RQ3定向边界框在密集航空场景中是否能提供相对于轴对齐框的显著收益?
  • RQ4DOTA在小/大对象平衡、拥挤度和极端纵横比方面如何挑战检测器?

主要发现

  • DOTA在2806张高分辨率图像中覆盖15个类别,共188,282个实例,成为迄今为止最大的标注航空-object数据集。
  • 为OBB训练/适配的检测器在拥挤和长条形对象中相对于HBB显示出显著改进。
  • 基线结果显示在航空场景中的小对象和密集对象存在显著困难(如小/大车辆、船只),不同类别表现不一。
  • 跨数据集实验显示UCAS-AOD与DOTA之间存在显著的泛化差距,表明DOTA具有更高的多样性和挑战性。
  • 使用定向四边形的专用标注相较水平框提供更紧的包围和更好分离邻近实例。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。